MosaicOS:一种简单有效的以对象为中心图像用于长尾目标检测的方法
计算机视觉与模式识别
2021-09-14 v3
摘要
许多对象在复杂场景中出现的频率不足以训练出准确的目标检测器(例如客厅中某些手袋),但它们自身却常频繁出现(例如产品图像中)。然而,这些以对象为中心的图像并未被有效用于改进以场景为中心图像中的目标检测。本文提出以对象为中心图像拼贴为以场景为中心图像(Mosaic of Object-centric images as Scene-centric images, MosaicOS),这是一个简单而新颖的框架,在应对长尾目标检测挑战方面出奇有效。我们方法的关键在于三点:(i)由以对象为中心的图像构建伪以场景为中心图像以缓解领域差异,(ii)利用以对象为中心图像的类别标签进行高质量边界框填补,以及(iii)多阶段训练流程。在 LVIS 目标检测(及实例分割)上,MosaicOS 使稀有对象类别的平均精度相对提升达 60%(及 23%)。我们还表明,我们的框架可兼容其他现有方法使用以取得进一步增益。我们的预训练模型公开于 https://github.com/czhang0528/MosaicOS/。
引用
@article{arxiv.2102.08884,
title = {MosaicOS: A Simple and Effective Use of Object-Centric Images for Long-Tailed Object Detection},
author = {Cheng Zhang and Tai-Yu Pan and Yandong Li and Hexiang Hu and Dong Xuan and Soravit Changpinyo and Boqing Gong and Wei-Lun Chao},
journal= {arXiv preprint arXiv:2102.08884},
year = {2021}
}
备注
Accepted to ICCV 2021