中文

将上下文重新引入物体识别中

计算机视觉与模式识别 2025-03-12 v2

摘要

在物体识别中,感兴趣对象(为简�起见称为前景,FG)及其周围环境(背景,BG)都可能发挥重要作用。然而,标准的监督学习往往导致对BG的意外过度依赖,限制了模型在实际部署场景中的鲁棒性。该问题主要通过抑制BG来解决,但这以牺牲上下文信息为代价,以换取更好的泛化能力。我们提出了一种新颖的识别方法"Localize to Recognize Robustly"(L2R2),该方法在保持对分布迁移的鲁棒性的同时,利用了上下文感知分类的优势。L2R2利用零样本检测的最新进展,在识别前对FG进行局部定位。它改进了标准监督训练下的常规识别性能,以及基于视觉语言模型(VLM)的多模态零样本识别性能,同时对长尾BG和分布迁移具有鲁棒性。结果表明,在广泛的数据集上,在识别前进行局部定位是可行的,并揭示了物体检测在某些数据集上的局限性。

关键词

引用

@article{arxiv.2411.15933,
  title  = {Bringing the Context Back into Object Recognition, Robustly},
  author = {Klara Janouskova and Cristian Gavrus and Jiri Matas},
  journal= {arXiv preprint arXiv:2411.15933},
  year   = {2025}
}