中文

艺术构成:注意力正则化训练用于组合视觉 grounding

计算机视觉与模式识别 2026-05-08 v3 计算与语言 机器学习

摘要

视觉语言模型 (VLM) 在隐式和显式视觉 grounding 及相关任务上取得了强大的性能。然而,这些能力通常在简单、单对象短语上进行测试。我们发现,针对复杂、多对象参考的 grounding 性能会下降。这些限制主要源于利用图像-标题对齐的训练目标,其中直接的多对象参考较少,可能的参考数量在理论上随对象数量呈指数增长,且归因困难。为此,我们提出一种无需额外标注的组合注意力正则化训练 (CompART),将标题分解为对象中心短语,并通过连接词构建组合短语。我们引入一种组合损失,鼓励组合短语引发的注意力等于其组成短语注意力的和,从而促进多对象局部的平衡。我们在四个 VLM 架构上进行评估,这些架构覆盖对比式和生成式模型,在四个多对象 grounding 基准和两个 VQA 基准上进行一般视觉理解评估。CompART 在 diverse VLM 架构和数据集上 consistently improve 单和多对象 reference 的 grounding,进一步证明在 VQA 上的提升,尽管未专门训练此任务。

关键词

引用

@article{arxiv.2412.08110,
  title  = {The ART of Composition: Attention-Regularized Training for Compositional Visual Grounding},
  author = {Jiayun Luo and Mir Rayat Imtiaz Hossain and Pritam Sarkar and Boyang Li and Leonid Sigal},
  journal= {arXiv preprint arXiv:2412.08110},
  year   = {2026}
}