- 提供软硬一体化高端视觉检测解决方案 - 提供软硬一体化高端视觉检测解决方案

logo - 科技
分类、检测还是分割?一文读懂计算机视觉三大核心任务
2026-07-27 13:12:15

  (来源:OpenCV与AI深度学习)

  视觉/图像重干货,第一时间送达!

      在计算机视觉中,“分类(Classification)”、“检测(Detection)”和“分割(Segmentation)”这三个术语,似乎都意味着“识别图像中的特定物体”。但从技术内核来看,它们彼此有着本质的区别。

      本文将用最直观的方式,结合具体的应用场景(以苹果品质分析为例),带你彻底理清这三者的边界。

  一、分类:这张图里“有什么”?

      分类(Classification) 用于判断整张图像的类别。换句话说,它只是给图片贴上一个或多个标签。

      在这个过程中,模型并不关心物体在图片中的具置,也不会绘制包围框。它只回答一个问题:“这张图属于哪个(些)类别?”

      以苹果图片为例,分类可以告诉我们苹果的品相:健康、腐烂、瘀伤等。根据业务需求,分类主要分为以下三种类型:

      1. 二元分类(Binary Classification)

      只有两种可能的类别,每张图片对应一个标签。

    •   示例:健康 或 瘀伤。

   2. 多类分类(Multi-class Classification)

      有三个或更多类别,但每张图像仍然只有一个标签(模型只会选择概率最高的一个类别)。

    •   示例:健康、瘀伤 或 病变。当一张图片里只有一个苹果时,这种方法效果很好。

    •   ⚠️ 注意:它被称为“多类”,而不是“多标签”。

  3. 多标签分类(Multi-label Classification)

      一张图片可以同时拥有多个标签

    •   示例:(瘀伤 + 病变)或(过熟 + 表皮缺陷)。当图像中包含多个苹果时,多标签分类可以指出每个标签对应的类别,或者统计图像中健康和受损苹果的数量。

    •   局限性:它适合判断图像整体的属性,但对“单个苹果”的精细分级无效。

      📌 适用场景:如果你的目标是将每个苹果归入“健康、轻微瘀伤、严重瘀伤”三类之一,那么分类是最佳选择。

  二、分割:具体“是哪些像素”属于它?

      分割(Segmentation) 不仅要识别图像中的物体,还要提取精确的像素区域。它回答的问题是:

  “具体哪些像素属于这个目标?”

      在分割结果中,图像被划分为不同的区域,每个像素都被分配一个标签。例如在一张苹果图片中:受损部分被标记为蓝色像素,健康部分被标记为绿色像素,背景则是黑白像素。

      在训练时,用户需要标注出哪个区域是瘀伤。模型预测后会输出瘀伤的掩膜(Mask),进而可以精确计算出瘀伤面积占苹果总面积的百分比。

      分割主要分为以下三种类型:

  1. 语义分割(Semantic Segmentation)

      “语义”指的是意义或类别。模型预测每一个像素属于哪个类别。

    •   特点:所有属于“苹果”的像素都会被归为一类,所有属于“瘀伤”的像素也会被归为一类。

    •   局限:模型无法区分个体。例如图中有三个苹果,语义分割会把它们全部标成同一种颜色,看不出“Apple 1”和“Apple 2”的区别。

    2. 实例分割(Instance Segmentation)

      它关注的是图像中不同个体的实例

    •   特点:即使三颗苹果都属于同一类别,实例分割也会将它们识别为不同的物体,并赋予不同颜色的掩膜。模型会学习识别物体的边界、形状、边缘、纹理和颜色变化。

    •   局限:主要关注可数的前景对象,不对背景进行标签或身份识别。此外,不同物体的预测掩膜可能会重叠(例如两个苹果紧挨着时,模型可能对某些像素的归属产生冲突)。

   3. 全景分割(Panoptic Segmentation)

      顾名思义,它提供了“全景”信息,是语义分割和实例分割的结合

    •   特点

      •   实例分割负责分别识别每个独立的苹果(前景)。

      •   语义分割负责识别苹果中健康的部分或受伤部分的像素(背景及区域属性)。优势:它解决了掩膜重叠的问题,输出的全景图包含不重叠的区域,并且对场景中的每一个像素(包括背景)都进行了解释。

    •   📌 适用场景:如果你的目标是找到确切的受伤部位,并计算其面积或占比,那么语义分割是最佳选择。

  三、检测:物体在“哪里”?

      物体检测(Object Detection) 旨在识别图像中存在的物体,并定位其位置。它预测三件事:

    •   类别标签:图像里有什么(如“苹果”)。

    •   边界框(Bounding Box):物体在哪里,用矩形框标出。

    •   置信度(Confidence Score):模型对该预测的确信程度(如 94%)。

      它回答的核心问题是:

  有哪些物体存在?它们在哪里?总共有多少个?

      根据物体的姿态和拍摄视角,边界框有不同的形式:

  检测类型

  核心特点

  典型应用场景

  轴向对齐检测

  最常见的形式。边界框始终保持水平和垂直,即使物体本身是倾斜的。

  通用物体检测(代表模型:YOLO, Faster R-CNN, SSD, DETR)

  旋转物体检测

  生成顺应物体方向的旋转边界框(OBB)。

  航拍图像、船舶、车辆、传送带上角度各异的水果

  3D 物体检测

  在三维空间中预测物体的位置和朝向,输出 3D 边界框。

  激光雷达、深度相机、自动驾驶、农业机器人

      📌 适用场景:如果你需要统计苹果的数量、定位每个苹果的位置,并粗略判断是否有瘀伤,那么物体检测是最佳选择。

  四、总结:如何选择合适的技术?

      为了更直观地理解,我们可以看下面这张对比图(图4):

    •   分类:只告诉你“这是个苹果,而且看起来不太新鲜”。

    •   检测:用框圈出苹果,告诉你“这里有3个苹果,置信度94%,其中1个可能有损伤”。

    •   分割:精确描出每个苹果的轮廓,并用不同颜色填充出“哪里是瘀伤,哪里是健康果肉”。

      决策指南:

    •   分类:对整个物体进行定性分级(如好/坏)。

    •   检测定位并计数物体,或找出大致的异常区域。

    •   分割精确测量异常区域的面积、比例或体积。

      在真实的工业应用(如苹果品质分析)中,这三种技术往往不是互斥的,而是可以根据所需的细节水平进行组合使用。

特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。
logo - 科技
  • 媒体合作 PocketGames@whpzw.com

    市场合作 PocketGames@163.com

  • 电话: 400-83375510