中文

DreamPRM-1.5:释放每个实例在多模态过程奖励模型训练中的潜力

机器学习 2025-10-22 v2

摘要

训练多模态过程奖励模型(PRM)面临两大挑战:(i)训练集与测试集之间的分布偏移,以及(ii)训练数据样本之间的质量不平衡。虽然域级重加权(如 DreamPRM)使训练与测试时目标对齐,但它与 Oracle 上界(pass@N)之间仍存在明显差距,即使在利用测试集数据探测余地的"合理性检验"中也是如此——这指向了元层面的参数不足。我们提出了 DreamPRM-1.5,一个实例级重加权框架,通过双层优化为每个训练样本分配自适应权重。为实现跨规模的实例重加权,我们开发了两种互补方案:实例表(Instance Table),它学习显式的每样本权重,在小/中规模数据上表现优异;以及实例网络(Instance Net),一个轻量级神经网络,泛化能力更强且可扩展至大规模语料库。一个实用的稳定训练方案——上下层更新之间的时间尺度匹配、冷启动初始化和有界范围权重——防止了发散。结合测试时缩放,DreamPRM-1.5 在 MMMU 验证集上达到 84.6 准确率,在 R-Bench-V 上达到 31.3 准确率,并且当与主流骨干模型(如 GPT-5-mini)配对时,在公开多模态推理排行榜上取得了第一名成绩。此外,大量实验,包括基准评估、基线比较和合理性检验,证明了 DreamPRM-1.5 缩小了与 Oracle 的差距、实现了领先性能并稳定训练。

关键词

引用

@article{arxiv.2509.05542,
  title  = {DreamPRM-1.5: Unlocking the Potential of Each Instance for Multimodal Process Reward Model Training},
  author = {Qi Cao and Pengtao Xie},
  journal= {arXiv preprint arXiv:2509.05542},
  year   = {2025}
}