Critic-V:VLM 评论家帮助捕捉 VLM 在多模态推理中的错误
计算机视觉与模式识别
2025-04-24 v5 计算与语言
摘要
视觉语言模型(VLMs)在多模态推理任务中取得了显著进展,但仍常因幻觉图像理解或推理路径不完善而生成不准确或无关响应。为此,我们引入 Critic-V,一种受 Actor-Critic 范式启发的新型框架,以提升 VLMs 的推理能力。该框架通过集成两个独立组件来分离推理过程与评论过程:Reasoner 基于视觉和文本输入生成推理路径,Critic 提供建设性评论以细化这些路径。在此方法中,Reasoner 根据文本提示生成推理响应,可根据 Critic 的反馈进行迭代演化。这种交互过程基于强化学习框架进行理论驱动,Critic 提供自然语言评论而非标量奖励,使 Reasoner 能够获得更细致的反馈以提升在复杂推理任务上的能力。Critic 模型采用直接偏好优化(DPO)进行训练,利用基于规则奖励(RBR)排序的评论数据集来增强其评论能力。评估结果表明,Critic-V 框架在 8 个基准测试中显著优于现有方法,包括 GPT-4V,尤其在推理准确率和效率方面表现突出。结合 Reasoner 的动态文本策略与经偏好优化的 Critic 的建设性反馈,实现了更可靠、情境敏感的多模态推理过程。我们的做法为增强 VLMs 可靠性提供了有前景的解决方案,提升了其在自动驾驶和具身智能等现实世界推理密集型多模态应用中的性能。
引用
@article{arxiv.2411.18203,
title = {Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning},
author = {Di Zhang and Junxian Li and Jingdi Lei and Xunzhi Wang and Yujie Liu and Zonglin Yang and Jiatong Li and Weida Wang and Suorong Yang and Jianbo Wu and Peng Ye and Wanli Ouyang and Dongzhan Zhou},
journal= {arXiv preprint arXiv:2411.18203},
year = {2025}
}
备注
16 pages, 11 figures