中文

基于视觉程序的多模态CoT奖励模型分步基准测试

计算机视觉与模式识别 2025-04-10 v1

摘要

近期在大型语言模型(LLM)中应用奖励信号方面取得了显著进展。然而,在向多模态领域过渡使用奖励信号时,仍面临标注工作量大、过度依赖单步奖励以及评估不足等诸多挑战。为此,本文提出了SVIP(Step-level Vision Instruction Programming)方法,旨在自动训练面向多模态CoT(Chain-of-Thought)奖励模型。该方法生成解决视觉任务所需的代码,将代码块的分析转化为CoT步骤评估的训练样本。随后,我们采用称为TriAtt-CoT的多头注意力机制训练SVIP奖励模型。实验结果表明,SVIP奖励模型在MLLM(多模态大语言模型)的整个训练与推理扩展过程中均表现出优势,能够在基准测试中获得更好结果,同时减少幻觉现象并提升推理能力。我们还引入了一个用于CoT奖励模型训练与测试的基准测试套件。

关键词

引用

@article{arxiv.2504.06606,
  title  = {Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program},
  author = {Minghe Gao and Xuqi Liu and Zhongqi Yue and Yang Wu and Shuang Chen and Juncheng Li and Siliang Tang and Fei Wu and Tat-Seng Chua and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2504.06606},
  year   = {2025}
}