中文

面向知识密集型视觉 grounding 的知识感知推理与强化学习:KARL

计算机视觉与模式识别 2026-04-03 v3 人工智能 计算与语言

摘要

知识密集型视觉 grounding(KVG)要求模型使用特定实体名称而非通用指代表达式来定位对象。虽然多模态大语言模型(MLLM)拥有丰富的实体知识和强大的通用 grounding 能力,但往往无法在 grounding 专业概念时有效利用此类知识,导致内部知识与 grounding 预测之间存在知识-grounding 鸿沟。为此,我们提出一种知识感知训练范式。我们的 methods首先构建知识引导的推理数据,以鼓励模型在 grounding 时激活领域相关实体知识。随后,我们引入 KARL,即知识感知强化学习框架,该框架根据模型对不同实体知识掌握程度的估计,适应性地调节奖励信号。为便于系统评估,我们引入 KVG-Bench,涵盖 10 个领域,包含 1.3K 条精心策划的测试案例,覆盖 531 张图片和 882 个实体。大量实验表明,我们的方法在广泛的基线模型上均表现出色,在未见类别的跨域泛化方面显著优于其他方法。该项目的数据、代码和模型已发布于 https://github.com/thunlp/KARL。

关键词

引用

@article{arxiv.2503.12797,
  title  = {KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding},
  author = {Xinyu Ma and Ziyang Ding and Zhicong Luo and Chi Chen and Zonghao Guo and Derek F. Wong and Zhen Zhao and Xiaoyi Feng and Maosong Sun},
  journal= {arXiv preprint arXiv:2503.12797},
  year   = {2026}
}