中文

识别任意区域

计算机视觉与模式识别 2025-04-22 v3 人工智能

摘要

理解无约束图像中单个区域或块的语义(如开放世界目标检测)仍是计算机视觉中关键且具挑战性的任务。基于 CLIP 等强大图像级视觉-语言(ViL)基础模型的成功,近期研究试图通过要么从大量区域-标签对从头训练对比模型,要么将检测模型输出与区域提议的图像级表示对齐来利用其能力。尽管取得显著进展,这些方法受困于计算密集的训练需求、对数据噪声的敏感性以及上下文信息的缺失。为应对这些局限,我们探索现成基础模型的协同潜力,利用其各自在定位与语义上的优势。我们引入一种新颖、通用且高效的架构,名为 RegionSpot,旨在将来自定位基础模型(如 SAM)的位置感知定位知识与来自 ViL 模型(如 CLIP)的语义信息相整合。为充分利用预训练知识同时最小化训练开销,我们保持两个基础模型冻结,仅将优化集中于轻量级基于注意力的知识整合模块。开放世界目标识别上的广泛实验表明,我们的 RegionSpot 相较先前方案取得显著性能提升,并大幅节省计算(例如,用 8 块 V100 GPU 在单日内以 300 万数据训练我们的模型)。RegionSpot 在 LVIS val 集上以 2.9 mAP 优于 GLIP-L,对更具挑战性的稀有类别 AP 优势更达 13.1,且在 ODinW 上 AP 提升 2.5。此外,在 LVIS minival 集上其对稀有类别以 11.0 AP 超过 GroundingDINO-L。

关键词

引用

@article{arxiv.2311.01373,
  title  = {Recognize Any Regions},
  author = {Haosen Yang and Chuofan Ma and Bin Wen and Yi Jiang and Zehuan Yuan and Xiatian Zhu},
  journal= {arXiv preprint arXiv:2311.01373},
  year   = {2025}
}

备注

NeurIPS 2024. Github: https://github.com/Surrey-UPLab/Recognize-Any-Regions