中文

基于自奖励的跨域多模态连贯推理

计算机视觉与模式识别 2025-12-30 v1 人工智能

摘要

多模态大语言模型常产生流畅但不可靠的推理,表现出弱的逐步连贯性和不足的视觉锚定,主要原因在于现有对齐方法仅监督最终答案,忽略中间推理过程的可靠性。我们提出SR-MCR,一个轻量级且无标签的框架,通过直接从模型输出中派生的内在过程信号来实现推理对齐。将五个自指线索——语义对齐、词汇保真性、非冗余性、视觉锚定和步骤一致性——整合到归一化的、可靠性加权奖励中,以提供细粒度的过程级指导。基于无评论的GRPO目标,增强了置信度感知的冷却机制,进一步稳定训练,抑制平凡或过度自信的生成。基于Qwen2.5-VL的SR-MCR在广泛的视觉基准测试中显著提升了答案准确率和推理连贯性;在同等规模的开源模型中,SR-MCR-7B实现了最先进的性能,平均准确率达81.4%。消融研究确认每个奖励项和冷却模块的独立贡献。

关键词

引用

@article{arxiv.2512.22545,
  title  = {Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains},
  author = {Jesen Zhang and Ningyuan Liu and Kaitong Cai and Sidi Liu and Jing Yang and Ziliang Chen and Xiaofei Sun and Keze Wang},
  journal= {arXiv preprint arXiv:2512.22545},
  year   = {2025}
}