中文

MOSS-ChatV:基于过程推理奖励的强化学习视频时序推理

计算机视觉与模式识别 2025-09-29 v2

摘要

视频推理已成为多模态大语言模型(MLLM)的关键能力,要求模型超越静态感知,才能对复杂场景中的时序动态进行连贯理解。然而,现有MLLM常出现过程不一致问题,即使最终答案正确,中间推理仍可能偏离视频动态,削弱可解释性和鲁棒性。为此,我们引入MOSS-ChatV,一种基于动态时间变形(DTW)的过程奖励的强化学习框架。该规则化奖励将推理轨迹与时序锚定参考对齐,实现无需辅助奖励模型即可进行高效过程监督。我们进一步识别动态状态预测是视频推理的关键衡量指标,构建MOSS-Video基准数据集,标注推理轨迹,其中训练分割用于微调MOSS-ChatV,保留测试分割用于评估。MOSS-ChatV在MOSS-Video(测试集)上达到87.2%的成绩,并在通用视频基准如MVBench和MMVU上实现性能提升。该框架在不同架构(包括Qwen2.5-VL和Phi-2)上均取得一致 gains,证明其广泛适用性。借助GPT-4o作为评判员的评估,MOSS-ChatV产生的推理轨迹更加一致和稳定。

关键词

引用

@article{arxiv.2509.21113,
  title  = {MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning},
  author = {Sicheng Tao and Jungang Li and Yibo Yan and Junyan Zhang and Yubo Gao and Hanqian Li and ShuHang Xun and Yuxuan Fan and Hong Chen and Jianxiang He and Xuming Hu},
  journal= {arXiv preprint arXiv:2509.21113},
  year   = {2025}
}