中文

基于大型视觉模型的通用目标检测

计算机视觉与模式识别 2023-10-13 v3

摘要

近年来,人们对开发广泛、通用且普适的计算机视觉系统越来越感兴趣。这类系统有潜力同时处理广泛的视觉任务,而不局限于特定问题或数据领域。这种通用性对于实际的、真实世界的计算机视觉应用至关重要。在本研究中,我们聚焦于一个具体的挑战:大规模、多领域的通用目标检测问题,这有助于实现通用视觉系统的更宏大目标。该问题带来了若干复杂的挑战,包括跨数据集类别标签重复、标签冲突,以及处理层级分类体系的必要性。为应对这些挑战,我们引入了标签处理方法、层级感知损失设计,以及利用预训练大型视觉模型进行资源高效的模型训练。我们的方法表现出卓越的性能,在2022年鲁棒视觉挑战赛(RVC 2022)的目标检测赛道中,于百万级跨数据集目标检测基准上荣获第二名。我们相信,这项全面的研究将为计算机视觉社区解决类似挑战提供有价值的参考和替代方案。我们工作的源代码已在 https://github.com/linfeng93/Large-UniDet 上公开。

关键词

引用

@article{arxiv.2212.09408,
  title  = {Universal Object Detection with Large Vision Model},
  author = {Feng Lin and Wenze Hu and Yaowei Wang and Yonghong Tian and Guangming Lu and Fanglin Chen and Yong Xu and Xiaoyu Wang},
  journal= {arXiv preprint arXiv:2212.09408},
  year   = {2023}
}

备注

Accepted by International Journal of Computer Vision (IJCV). The 2nd place in the object detection track of the Robust Vision Challenge (RVC 2022)