看错了还是想错了?面向视觉语言推理的感知奖励
人工智能
2026-05-15 v1 计算机视觉与模式识别
摘要
实现稳健的感知-推理协同是高级视觉语言模型 (VLMs) 的核心目标。最近的进展通过架构设计或智能体工作流追求这一目标。然而,这些方法通常受限于静态文本推理,或者因外部智能体复杂性带来的巨大计算和工程负担而变得复杂。更糟糕的是,这种沉重的投资并没有带来成比例的收益,在感知和推理上经常出现“跷跷板效应”。这促使人们重新思考真正的瓶颈所在。在本文中,我们论证了这种权衡的根本原因在于模态贡献归因的模糊性:当 VLM 失败时,是由于有缺陷的感知(“看错了”)还是有缺陷的逻辑(“想错了”)?为了解决这个问题,我们引入了一个强化学习框架,通过可靠地奖励感知保真度来改善感知-推理协同。我们明确地将生成过程分解为交替的感知和推理步骤。这种解耦实现了对感知的针对性监督。至关重要的是,我们引入了感知验证 (PV),利用“蒙眼推理”代理独立于推理结果来奖励感知保真度。此外,为了在自由形式的视觉语言任务中扩展训练,我们提出了结构化口头验证,用结构化的算法执行取代高方差的 LLM 评判。这些技术被集成到模态感知贡献归因 (MoCA) 机制中,该机制将奖励路由到特定的错误来源——无论是看错还是想错——使得单个 VLM 能够在广泛的任务范围内实现同步的性能提升。
引用
@article{arxiv.2605.14054,
title = {Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning},
author = {Haozhe Wang and Qixin Xu and Changpeng Wang and Taofeng Xue and Chong Peng and Wenhu Chen and Fangzhen Lin},
journal= {arXiv preprint arXiv:2605.14054},
year = {2026}
}
备注
Accepted by ICML 2026 as Spotlight