PaLMR:通过多模态过程对齐实现可靠视觉推理
计算机视觉与模式识别
2026-03-10 v1 人工智能
摘要
强化学习最近提高了大型语言模型和多模态LLM的推理能力,但现行奖励设计侧重最终答案的正确性,从而容忍process hallucinations--即模型在误感知视觉证据时仍能得出正确答案的情形。我们通过PaLMR框架解决process-level misalignment,该框架不仅对结果进行对齐,还对推理过程本身进行对齐。PaLMR由两个互补组件组成:感知对齐的数据层,其构建具有结构化伪基准和可验证视觉事实的process-aware reasoning data,以及process-aligned optimisation layer,其构建具有process-aware scoring function的分层奖励融合方案,以鼓励视觉忠实的链式思考并提高训练稳定性。在Qwen2.5-VL-7B模型上进行实验表明,该方法显著减少了推理幻觉,提升了视觉推理忠诚度,在HallusionBench上实现了state-of-the-art结果,同时在MMMU、MathVista和MathVerse上保持强大的性能。这些发现表明,PaLMR为process-aligned multimodal reasoning提供了原则且实用的途径,推动了MLLMs可靠性和可解释性的提升。
引用
@article{arxiv.2603.06652,
title = {PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment},
author = {Yantao Li and Qiang Hui and Chenyang Yan and Kanzhi Cheng and Fang Zhao and Chao Tan and Huanling Gao and Jianbing Zhang and Kai Wang and Xinyu Dai and Shiguo Lian},
journal= {arXiv preprint arXiv:2603.06652},
year = {2026}
}