ViCrit:用于VLMs视觉感知的可验证强化学习代理任务
计算机视觉与模式识别
2025-06-13 v1 机器学习
摘要
强化学习(RL)在利用具有挑战性且易于验证的任务(如数学推理或代码生成)微调大语言模型(LLM)方面已显示出显著成效。然而,将这一成功扩展到视觉语言模型(VLMs)中的视觉感知受到同时具有挑战性和明确可验证的视觉中心任务稀缺的阻碍。为此,我们引入了ViCrit(视觉描述幻觉批评),一个RL代理任务,训练VLMs在人类书写的图像段落中定位注入的细微合成视觉幻觉。从200字的描述出发,我们注入一个细微的视觉描述错误——改变关于物体、属性、数量或空间关系的几个词——并要求模型在给定图像和修改后描述的情况下精确定位被篡改的片段。该公式保留了完整的感知难度,同时提供了一个易于计算且无歧义的二元精确匹配奖励。使用ViCrit任务训练的模型在多种VL基准测试中表现出显著提升。关键的是,这些提升超越了自然图像训练数据,扩展到抽象图像推理和视觉数学,展现出学习感知而非仅仅记忆所见物体的前景。为了便于评估,我们进一步引入了ViCrit-Bench,一个类别平衡的诊断基准,系统地探测多样化图像领域和错误类型中的感知错误。我们的结果共同表明,细粒度的幻觉批评是增强VLMs中视觉感知的有效且可泛化的目标。
引用
@article{arxiv.2506.10128,
title = {ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs},
author = {Xiyao Wang and Zhengyuan Yang and Chao Feng and Yongyuan Liang and Yuhang Zhou and Xiaoyu Liu and Ziyi Zang and Ming Li and Chung-Ching Lin and Kevin Lin and Linjie Li and Furong Huang and Lijuan Wang},
journal= {arXiv preprint arXiv:2506.10128},
year = {2025}
}