基于视觉程序的多模态CoT奖励模型分步基准测试
计算机视觉与模式识别
2025-04-10 v1
摘要
近期在大型语言模型(LLM)中应用奖励信号方面取得了显著进展。然而,在向多模态领域过渡使用奖励信号时,仍面临标注工作量大、过度依赖单步奖励以及评估不足等诸多挑战。为此,本文提出了SVIP(Step-level Vision Instruction Programming)方法,旨在自动训练面向多模态CoT(Chain-of-Thought)奖励模型。该方法生成解决视觉任务所需的代码,将代码块的分析转化为CoT步骤评估的训练样本。随后,我们采用称为TriAtt-CoT的多头注意力机制训练SVIP奖励模型。实验结果表明,SVIP奖励模型在MLLM(多模态大语言模型)的整个训练与推理扩展过程中均表现出优势,能够在基准测试中获得更好结果,同时减少幻觉现象并提升推理能力。我们还引入了一个用于CoT奖励模型训练与测试的基准测试套件。
引用
@article{arxiv.2504.06606,
title = {Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program},
author = {Minghe Gao and Xuqi Liu and Zhongqi Yue and Yang Wu and Shuang Chen and Juncheng Li and Siliang Tang and Fei Wu and Tat-Seng Chua and Yueting Zhuang},
journal= {arXiv preprint arXiv:2504.06606},
year = {2025}
}