中文

学习在开放世界中检测一切事物

计算机视觉与模式识别 2022-04-14 v2

摘要

许多开放世界应用需要检测新颖物体,然而最先进的目标检测与实例分割网络在此任务上表现不佳。关键问题在于它们假设任何无标注的区域都应作为负样本被抑制,这导致模型将未标注物体当作背景。为解决该问题,我们提出了一种简单却出奇强大的数据增强与训练方案,称为学习检测一切事物(Learning to Detect Every Thing, LDET)。为避免抑制隐藏物体(即可见但未标注的背景物体),我们将标注物体粘贴到从原始图像一小块区域采样得到的背景图像上。由于仅在此类合成增强图像上训练会受域偏移影响,我们将训练解耦为两部分:1)在增强图像上训练区域分类与回归头;2)在原始图像上训练掩码头。如此,模型不会将隐藏物体学习为背景,同时能很好地泛化到真实图像。LDET 在开放世界实例分割任务的多个数据集上取得显著提升,在 COCO 上的跨类别泛化以及 UVO 和 Cityscapes 上的跨数据集评测中均优于基线。

关键词

引用

@article{arxiv.2112.01698,
  title  = {Learning to Detect Every Thing in an Open World},
  author = {Kuniaki Saito and Ping Hu and Trevor Darrell and Kate Saenko},
  journal= {arXiv preprint arXiv:2112.01698},
  year   = {2022}
}

备注

Project page is available at https://ksaito-ut.github.io/openworld_ldet/