中文

从丰富语义与粗略位置中学习用于长尾目标检测

计算机视觉与模式识别 2023-10-19 v1

摘要

长尾目标检测(LTOD)旨在处理真实世界数据集中的极端数据不平衡,其中许多尾部类实例稀少。一种流行策略是探索带图像级标签的额外数据,但由于(1)语义歧义——图像级标签仅捕捉图像显著部分,忽略图像内其余丰富语义;以及(2)位置敏感性——标签高度依赖原始图像的位置与裁剪,在随机裁剪等数据变换后可能改变,该方法效果有限。为此,我们提出 RichSem,一种简单而有效的方法,能从粗略位置鲁棒地学习丰富语义,无需精确边界框。RichSem 利用图像中的丰富语义,将其作为训练检测器的额外软监督。具体而言,我们向检测器添加语义分支以学习这些软语义并增强长尾目标检测的特征表示。该语义分支仅用于训练,推理时移除。RichSem 在不同骨干网络与检测器下于 LVIS 的整体与稀有类别上均取得一致提升。我们的方法无需复杂训练与测试流程即达到最先进性能。此外,我们在其他长尾数据集上通过额外实验展示了方法的有效性。代码见 \url{https://github.com/MengLcool/RichSem}。

关键词

引用

@article{arxiv.2310.12152,
  title  = {Learning from Rich Semantics and Coarse Locations for Long-tailed Object Detection},
  author = {Lingchen Meng and Xiyang Dai and Jianwei Yang and Dongdong Chen and Yinpeng Chen and Mengchen Liu and Yi-Ling Chen and Zuxuan Wu and Lu Yuan and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2310.12152},
  year   = {2023}
}

备注

Accepted by NeurIPS2023