MiCo:基于多图像对比的强化视觉推理
计算机视觉与模式识别
2025-06-30 v1
摘要
本工作探索了如何通过多图像间的视觉线索实现链式思考 (CoT) 推理。一种直观的解决方案是为视觉语言模型 (VLMs) 采用规则驱动的强化学习。然而,这类方法通常依赖于人工策划的问答对,在处理细粒度视觉细节和跨图像的复杂逻辑时颇具挑战性。灵感来自自监督视觉表征学习,我们注意到图像中包含可作为监督信息的内在约束。基于此洞见,我们构建了图像三元组:两个同一图像的增强视图和第三个相似但不同的图像。在训练期间,模型被提示生成推理过程以比较这些图像(即确定相同或不同)。随后我们采用规则驱动的强化学习优化模型。由于高视觉相似性和增强的存在,模型必须注意到细微的视觉变化并进行逻辑推理以取得成功。实验表明,尽管仅在视觉比较任务上训练,所学到的推理能力仍能有效泛化到广泛的问题范围。通过不依赖任何人工标注的问答对,我们的方法在多图像推理基准测试上取得显著改进,在通用视觉任务上也表现出强性能力。
引用
@article{arxiv.2506.22434,
title = {MiCo: Multi-image Contrast for Reinforcement Visual Reasoning},
author = {Xi Chen and Mingkang Zhu and Shaoteng Liu and Xiaoyang Wu and Xiaogang Xu and Yu Liu and Xiang Bai and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2506.22434},
year = {2025}
}