从对比视角出发:视觉语言模型自我提升的视觉推理
计算机视觉与模式识别
2026-03-04 v1 人工智能
计算与语言
机器学习
摘要
推理已成为大语言模型的关键能力。在语言任务中,这一能力可通过自我提升技术来优化后续微调的推理路径来实现提升。然而,将这些基于语言的自我提升方法扩展到视觉语言模型(VLMs)面临独特挑战:视觉幻觉在推理路径中难以有效验证或纠正。我们的解决方案基于一个关键观察:当面对对比式VQA配对(即两个视觉相似且问题等价的图像)时,VLMs能更精确地识别相关视觉线索。基于此,我们提出了视觉对比自学推理器(VC-STaR),这是一种新颖的自我提升框架,利用视觉对比来缓解模型生成理由中的幻觉问题。我们收集了多样化的VQA数据集,依据多模态相似性精选对比式配对,并使用VC-STaR生成理由。随后,我们获得了一个新的视觉推理数据集VisCoR-55K,用于提升各种VLMs的推理能力。广泛的实验表明,VC-STaR不仅超越现有自我提升方法,还超过在最先进视觉推理数据集上微调的模型,表明VLMs固有的对比能力可为其自身的视觉推理提供引擎。项目地址:https://github.com/zhiyupan42/VC-STaR。
引用
@article{arxiv.2603.02556,
title = {Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs},
author = {Zhiyu Pan and Yizheng Wu and Jiashen Hua and Junyi Feng and Shaotian Yan and Bing Deng and Zhiguo Cao and Jieping Ye},
journal= {arXiv preprint arXiv:2603.02556},
year = {2026}
}
备注
19 pages, 9 figures, accepted to ICLR 2026 (oral)