一、bbox 的基本构成
bbox 的核心是 坐标数据,通常以两种格式表示:- 左上角+右下角坐标:(x1, y1, x2, y2),其中 (x1,y1) 为矩形左上角像素点坐标,(x2,y2) 为右下角坐标。
- 中心坐标+宽高:(cx, cy, w, h),即矩形中心点坐标 (cx, cy) 与宽度 w、高度 h 的组合。
这些坐标以像素为单位,精确描述目标在图像中的位置和大小。
二、bbox 的核心应用场景
1. 目标检测 在 YOLO、Faster R-CNN 等主流检测模型中,bbox 用于框选行人、车辆、物体等目标,并配合类别标签如“猫”“汽车”实现实时识别。例如,安防摄像头通过 bbox 定位画面中的可疑人员,自动驾驶系统通过 bbox 识别道路上的交通标志。2. 图像标与训练 标工具如 LabelImg通过人工绘制 bbox 生成数据集,供 AI 模型学习目标特征。没有准确的 bbox 标,模型就法理“哪里有目标”“目标有多大”。
3. 视频追踪 在监控、影视特效中,bbox 随时间轴动态更新目标位置,实现对运动对象如足球、演员的持续追踪。
三、bbox 的类型
根据形状和用途,bbox 可分为两类:- 轴向对齐边界框AABB:矩形边与图像坐标轴平行,计算简单,广泛用于多数检测任务。
- 旋转边界框OBB:可围绕中心旋转,适合不规则目标如倾斜的文本、弯曲的物体,常见于卫星图像、工业质检场景。
四、bbox 的评估指标
衡量 bbox 准确性的核心指标是 交并比IOU,计算公式为: IOU = 预测框与真实框的交集面积 / 预测框与真实框的并集面积 IOU 值越接近 1,表示 bbox 定位越精准。当 IOU > 0.5 时,通常认为检测结果有效。从简单的矩形标记到支撑复杂 AI 决策,bbox 是计算机“看见”世界的基础工具。论是手机拍照时的人脸对焦框,还是人机巡检时的异常区域标记,其背后都离不开 bbox 的坐标逻辑。
