中文

Crowd-SAM:面向拥挤场景目标检测的 SAM 智能标注器

计算机视觉与模式识别 2024-07-22 v2

摘要

在计算机视觉中,目标检测是一种在许多场景中具有应用的重要任务。然而,获取大量标注数据在拥挤场景中往往具有挑战性。最近,Segment Anything Model (SAM) 被提出作为一种强大的零样本分割器,为实例分割任务提供了新方法。然而,SAM 及其变体在处理拥挤和遮挡场景中的目标时,往往会牺牲准确率和效率。本文引入 Crowd-SAM,一个基于 SAM 的框架,旨在以较少可学习参数和最小标注图像数量,提升 SAM 在拥挤和遮挡场景中的性能。我们引入了高效提示采样器 (EPS) 和部分-整体判别网络 (PWD-Net),增强了拥挤场景中的掩码选择和准确率。尽管方法简单,Crowd-SAM 在多个基准测试上(包括 CrowdHuman 和 CityPersons)的表现不逊于最先进的全监督目标检测方法。我们的代码已公开:https://github.com/FelixCaae/CrowdSAM。

关键词

引用

@article{arxiv.2407.11464,
  title  = {Crowd-SAM: SAM as a Smart Annotator for Object Detection in Crowded Scenes},
  author = {Zhi Cai and Yingjie Gao and Yaoyan Zheng and Nan Zhou and Di Huang},
  journal= {arXiv preprint arXiv:2407.11464},
  year   = {2024}
}

备注

Accepted by ECCV2024