中文

Qwen Look Again:引导视觉语言推理模型重新关注视觉信息

计算机视觉与模式识别 2025-06-02 v2 机器学习

摘要

推理时间缩放驱动了扩展推理,从而增强了视觉语言模型(VLMs)的性能,进而形成了强大的视觉语言推理模型(VLRMs)。然而,长推理过程会稀释视觉 token,导致视觉信息受到的关注减少,并可能引发幻觉。尽管在语言模型中引入纯文本反思过程展现出前景,但我们证明这不足以抑制 VLMs 中的幻觉。为解决此问题,我们引入了 Qwen-LookAgain(Qwen-LA),这是一种新型 VLRM,旨在通过引入视觉-文本反思过程来缓解幻觉,该过程引导模型在推理期间重新关注视觉信息。我们首先提出了一种强化学习方法 Balanced Reflective Policy Optimization(BRPO),该方法引导模型自主决定何时生成视觉-文本反思,并平衡反思的数量与长度。然后,我们正式证明了 VLRMs 随着推理的进行会对视觉 token 丧失注意力,并证明在反思期间补充视觉信息能增强视觉注意力。因此,在训练和推理期间,我们引入了 Visual Token COPY 和 Visual Token ROUTE,以在视觉层面强制模型重新关注视觉信息,从而解决纯文本反思的局限性。在多个视觉问答数据集和幻觉指标上的实验表明,Qwen-LA 在减少幻觉的同时实现了领先的准确率性能。我们的代码可在以下地址获取:https://github.com/Liar406/Look_Again

关键词

引用

@article{arxiv.2505.23558,
  title  = {Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information},
  author = {Xu Chu and Xinrong Chen and Guanyu Wang and Zhijie Tan and Kui Huang and Wenyu Lv and Tong Mo and Weiping Li},
  journal= {arXiv preprint arXiv:2505.23558},
  year   = {2025}
}