R-C2:循环一致的强化学习改进多模态推理
人工智能
2026-03-27 v1 计算机视觉与模式识别
摘要
鲁棒的感知与推理需要跨感官模态的一致性。然而当前的多模态模型常常违背这一原则,对同一概念的视觉和文本表示产生矛盾的预测。我们没有使用标准投票机制来掩盖这些失败(这可能放大系统性偏差),而是证明跨模态不一致为学习提供了丰富而自然的信号。我们引入了 R-C2,一个强化学习框架,通过强制跨模态循环一致性来解决内部冲突。通过要求模型执行反向推理、切换模态并通过正向推理可靠地重构答案,我们获得了密集的无标签奖励。这种循环约束鼓励模型自主对齐其内部表示。优化这一结构减轻了模态特定误差,并将推理准确率提高了最多 7.6 个百分点。我们的结果表明,先进的推理不仅来自数据规模的扩大,也来自对世界结构一致性的理解。
引用
@article{arxiv.2603.25720,
title = {R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning},
author = {Zirui Zhang and Haoyu Dong and Kexin Pei and Chengzhi Mao},
journal= {arXiv preprint arXiv:2603.25720},
year = {2026}
}