目的胜于旅程:视觉忠实性在慢速思考中的重要性
计算机视觉与模式识别
2025-12-22 v2 计算与语言
机器学习
摘要
推理增强的视觉语言模型(VLMs)生成显式的思考链,虽期望带来更大的能力和透明度,但也引入了新的失败模式:模型可能通过视觉不忠实的中间步骤到达正确答案,或进行忠实推理却在最终预测中失败。仅衡量最终答案准确性的标准评估无法区分这些行为。我们提出将推理链的视觉忠实性作为一个独立的评估维度,关注推理链的感知步骤是否真实地依据图像。我们提出了一个无需训练和参考的框架,将推理链分解为感知步骤与推理步骤,并使用现成的VLMs作为步骤级别的忠实性评估器,同时通过人类元评估验证了这一方法。基于此指标,我们提出了一种轻量级的自反思程序,用于检测和局部重生成不可忠实的感知步骤,无需任何训练。在多个经过推理训练的VLMs和感知密集型基准测试上,我们的方法在保持最终答案准确性的同时,降低了不可忠实感知率,提高了多模态推理的可靠性。
引用
@article{arxiv.2512.12218,
title = {Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking},
author = {Rheeya Uppaal and Phu Mon Htut and Min Bai and Nikolaos Pappas and Zheng Qi and Sandesh Swamy},
journal= {arXiv preprint arXiv:2512.12218},
year = {2025}
}
备注
Preprint