稳健上下文感知目标识别
几何拓扑
2025-11-14 v2
摘要
在视觉识别中,目标(foreground, FG)及其周围环境(背景, BG)都发挥重要作用。然而,标准监督学习常导致对背景的过度依赖,产生误导性相关性的捷径学习,限制模型在实际部署中的鲁棒性。文献中通常通过抑制背景来解决此问题,但牺牲了上下文信息。我们提出 RCOR(Robust Context-Aware Object Recognition)——首个在不牺牲上下文信息的情况下实现鲁棒性和上下文感知的端到端方法。RCOR 将局化任务融入识别过程,以实现对象中心建模与上下文感知建模的解耦,随后采用稳健、非参数的融合策略。实验表明,RCOR 在包含内域和外域背景的数据集上均能提升监督模型和视觉语言模型的性能,即使无需微调亦然。结果表明,仅凭局化即可实现复杂场景(如 ImageNet-1k)下的识别。
引用
@article{arxiv.2510.00617,
title = {A new proof of the virtual Haken conjecture},
author = {Charalampos Charitos},
journal= {arXiv preprint arXiv:2510.00617},
year = {2025}
}