以细粒度奖励揭示视觉-语言模型的逐步链推理
计算机视觉与模式识别
2025-09-24 v1
摘要
思维链推理在大语言模型中取得了显著成功,但其在视觉-语言推理中的适应仍是一个开放性挑战,最佳实践尚不明确。现有的尝试通常在粗粒度层面采用推理链,这难以执行细粒度的结构化推理,且更重要的是,难以评估中间推理的奖励和质量。在这项工作中,我们深入探讨了视觉-语言模型的逐步链推理,实现了对推理步骤质量的准确评估,并借由细粒度奖励实现了有效的强化学习和推理时间扩展。我们提出了一个简单、有效且完全透明的框架,包括步骤级推理数据、过程奖励模型(PRM)和强化学习训练。借助所提出的方法,我们的模型在具有挑战性的视觉-语言基准上设定了强有力的基线并取得持续改进。更重要的是,我们进行了彻底的实证分析和消融研究,揭示了各组件的影响以及推理时间扩展的若干有趣特性。我们相信本文可作为视觉-语言模型的基线,并为更复杂的多模态推理提供洞察。我们的数据集、PRM和代码将可在 https://github.com/baaivision/CoS 获取。
引用
@article{arxiv.2509.19003,
title = {Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards},
author = {Honghao Chen and Xingzhou Lou and Xiaokun Feng and Kaiqi Huang and Xinlong Wang},
journal= {arXiv preprint arXiv:2509.19003},
year = {2025}
}
备注
Accepted by NeurIPS 2025