(来源:OpenCV与AI深度学习)
视觉/图像重磅干货,第一时间送达!
在计算机视觉中,“分类(Classification)”、“检测(Detection)”和“分割(Segmentation)”这三个术语,似乎都意味着“识别图像中的特定物体”。但从技术内核来看,它们彼此有着本质的区别。
本文将用最直观的方式,结合具体的应用场景(以苹果品质分析为例),带你彻底理清这三者的边界。
一、分类:这张图里“有什么”?
分类(Classification) 用于判断整张图像的类别。换句话说,它只是给图片贴上一个或多个标签。
在这个过程中,模型并不关心物体在图片中的具置,也不会绘制包围框。它只回答一个问题:“这张图属于哪个(些)类别?”

以苹果图片为例,分类可以告诉我们苹果的品相:健康、腐烂、瘀伤等。根据业务需求,分类主要分为以下三种类型:
1. 二元分类(Binary Classification)
只有两种可能的类别,每张图片对应一个标签。
示例:健康 或 瘀伤。
2. 多类分类(Multi-class Classification)
有三个或更多类别,但每张图像仍然只有一个标签(模型只会选择概率最高的一个类别)。
示例:健康、瘀伤 或 病变。当一张图片里只有一个苹果时,这种方法效果很好。
⚠️ 注意:它被称为“多类”,而不是“多标签”。
3. 多标签分类(Multi-label Classification)
一张图片可以同时拥有多个标签。
示例:(瘀伤 + 病变)或(过熟 + 表皮缺陷)。当图像中包含多个苹果时,多标签分类可以指出每个标签对应的类别,或者统计图像中健康和受损苹果的数量。
局限性:它适合判断图像整体的属性,但对“单个苹果”的精细分级无效。
📌 适用场景:如果你的目标是将每个苹果归入“健康、轻微瘀伤、严重瘀伤”三类之一,那么分类是最佳选择。
二、分割:具体“是哪些像素”属于它?
分割(Segmentation) 不仅要识别图像中的物体,还要提取精确的像素区域。它回答的问题是:
“具体哪些像素属于这个目标?”

在分割结果中,图像被划分为不同的区域,每个像素都被分配一个标签。例如在一张苹果图片中:受损部分被标记为蓝色像素,健康部分被标记为绿色像素,背景则是黑白像素。
在训练时,用户需要标注出哪个区域是瘀伤。模型预测后会输出瘀伤的掩膜(Mask),进而可以精确计算出瘀伤面积占苹果总面积的百分比。
分割主要分为以下三种类型:
1. 语义分割(Semantic Segmentation)
“语义”指的是意义或类别。模型预测每一个像素属于哪个类别。
特点:所有属于“苹果”的像素都会被归为一类,所有属于“瘀伤”的像素也会被归为一类。
局限:模型无法区分个体。例如图中有三个苹果,语义分割会把它们全部标成同一种颜色,看不出“Apple 1”和“Apple 2”的区别。
2. 实例分割(Instance Segmentation)
它关注的是图像中不同个体的实例。
特点:即使三颗苹果都属于同一类别,实例分割也会将它们识别为不同的物体,并赋予不同颜色的掩膜。模型会学习识别物体的边界、形状、边缘、纹理和颜色变化。
局限:主要关注可数的前景对象,不对背景进行标签或身份识别。此外,不同物体的预测掩膜可能会重叠(例如两个苹果紧挨着时,模型可能对某些像素的归属产生冲突)。
3. 全景分割(Panoptic Segmentation)
顾名思义,它提供了“全景”信息,是语义分割和实例分割的结合。

特点:
实例分割负责分别识别每个独立的苹果(前景)。
语义分割负责识别苹果中健康的部分或受伤部分的像素(背景及区域属性)。优势:它解决了掩膜重叠的问题,输出的全景图包含不重叠的区域,并且对场景中的每一个像素(包括背景)都进行了解释。
📌 适用场景:如果你的目标是找到确切的受伤部位,并计算其面积或占比,那么语义分割是最佳选择。
三、检测:物体在“哪里”?
物体检测(Object Detection) 旨在识别图像中存在的物体,并定位其位置。它预测三件事:
类别标签:图像里有什么(如“苹果”)。
边界框(Bounding Box):物体在哪里,用矩形框标出。
置信度(Confidence Score):模型对该预测的确信程度(如 94%)。
它回答的核心问题是:
有哪些物体存在?它们在哪里?总共有多少个?
根据物体的姿态和拍摄视角,边界框有不同的形式:
检测类型 | 核心特点 | 典型应用场景 |
|---|---|---|
轴向对齐检测 | 最常见的形式。边界框始终保持水平和垂直,即使物体本身是倾斜的。 | 通用物体检测(代表模型:YOLO, Faster R-CNN, SSD, DETR) |
旋转物体检测 | 生成顺应物体方向的旋转边界框(OBB)。 | 航拍图像、船舶、车辆、传送带上角度各异的水果 |
3D 物体检测 | 在三维空间中预测物体的位置和朝向,输出 3D 边界框。 | 激光雷达、深度相机、自动驾驶、农业机器人 |
📌 适用场景:如果你需要统计苹果的数量、定位每个苹果的位置,并粗略判断是否有瘀伤,那么物体检测是最佳选择。

四、总结:如何选择合适的技术?
为了更直观地理解,我们可以看下面这张对比图(图4):
分类:只告诉你“这是个苹果,而且看起来不太新鲜”。
检测:用框圈出苹果,告诉你“这里有3个苹果,置信度94%,其中1个可能有损伤”。
分割:精确描出每个苹果的轮廓,并用不同颜色填充出“哪里是瘀伤,哪里是健康果肉”。
决策指南:
分类:对整个物体进行定性分级(如好/坏)。
检测:定位并计数物体,或找出大致的异常区域。
分割:精确测量异常区域的面积、比例或体积。
在真实的工业应用(如苹果品质分析)中,这三种技术往往不是互斥的,而是可以根据所需的细节水平进行组合使用。
- 提供软硬一体化高端视觉检测解决方案