中文

视觉思考的忠实性:测量与提升

计算机视觉与模式识别 2025-10-28 v1 人工智能

摘要

近期大型视觉语言模型 (LVM) 可在强化微调 (RFT) 后生成视觉-文本多模态链式思考 (MCoT) 轨迹。然而我们发现, 尽管 MCoT 仍能给出正确答案, 其中的视觉信息往往不够准确, 这表明 MCoT 推理过程缺乏忠实性。我们认为这种不忠实性源于 RFT 中的强化奖励, 该奖励仅激励交错式视觉-文本线索的格式, 即鼓励模型在文本推理步骤中加入视觉信息, 但未考虑其准确性。本文首先通过测量视觉与文本思考干预后的预测变化来探讨 MCoT 的忠实性。意外发现, 在视觉干预下模型预测几乎不变,但在文本干预下则发生显著变化, 这表明视觉证据被大量忽略。为进一步分析视觉信息, 我们引入一种基于自动化 LVM 的评估指标, 从可靠性和充分性两个角度量化 MCoT 轨迹中视觉线索的忠实性。评估结果显示, 当前 MCoT 轨迹中的视觉信息同时可靠性和充分性都不足。为解决此问题, 我们提出一种新颖的 MCoT 学习策略, 称为充分-成分原因模型 (SCCM) 学习。该方法鼓励 MCoT 生成足够且最小化的视觉组件, 这些组件本身即可独立导向正确答案。我们指出, 所提出的 SCCM 无需标注, 可即插即用地适用于各种 RFT MCoT。实验结果表明, SCCM 在一系列精细感知与推理基准测试中均能持续提升视觉忠实性。代码已公开于 https://github.com/EugeneLiu01/Faithful_Thinking_with_Image。

关键词

引用

@article{arxiv.2510.23482,
  title  = {On the Faithfulness of Visual Thinking: Measurement and Enhancement},
  author = {Zujing Liu and Junwen Pan and Qi She and Yuan Gao and Guisong Xia},
  journal= {arXiv preprint arXiv:2510.23482},
  year   = {2025}
}