多模态过程奖励模型的数据训练效率研究
机器学习
2026-02-06 v2 计算与语言
多媒体
摘要
多模态过程奖励模型 (MPRM) 是视觉推理 MLLM 步骤级监督的核心. 训练 MPRM 通常需要大规模蒙特卡洛 (MC) 标注语料, 造成巨大的训练成本. 本文研究了 MPRM 训练的数据效率.我们的初步实验表明, 在随机抽样训练数据的情况下, MPRM 训练会迅速饱和, 这表明现有 MC 标注语料中存在显著的 redundancy. 为解释这一现象, 我们形式化了一个理论框架, 揭示了信息丰富的梯度更新取决于两个因素: (1) 正负步骤标签的混合比例; (2) 标签可靠性 (正步骤平均 MC 评分). 在这些洞察指导下, 我们提出平衡信息得分 (Balanced-Information Score, BIS), 该得分基于现有 MC 信号在 rollout 级别上优先考虑混合与可靠性, 而无需额外成本. 在两个 backbone (InternVL2.5-8B 和 Qwen2.5-VL-7B) 上测试于 VisualProcessBench, BIS 选取的子集在小比例下始终匹配甚至超越完整数据性能. 值得注意的是, BIS 子集仅使用 10% 的训练数据即可达到完整数据的性能, 在随机抽样方面提升幅度为相对 4.1%.
引用
@article{arxiv.2602.04145,
title = {Training Data Efficiency in Multimodal Process Reward Models},
author = {Jinyuan Li and Chengsong Huang and Langlin Huang and Shaoyang Xu and Haolin Liu and Wenxuan Zhang and Jiaxin Huang},
journal= {arXiv preprint arXiv:2602.04145},
year = {2026}
}