中文

PRM-BAS:通过 PRM 引导的光束退火搜索提升多模态推理能力

多媒体 2025-04-15 v1

摘要

近年来,越来越多的工作致力于提高多模态大语言模型(MLLMs)的推理能力。其中,基于过程奖励模型(PRMs)的方法尤为突出,因其提供稠密、逐步的监督以引导中间推理。然而,如何有效地将 PRMs 集成到搜索策略中仍是一个开放问题。本文引入 PRM-BAS(PRM 引导的光束退火搜索),一种轻量级的 PRM 引导推理方法,动态调整光束大小——从较大的搜索空间开始,随着上下文信息的累积逐渐缩小,从而在性能和效率之间取得平衡。我们进一步提出了统一的数据构建和 PRM 训练框架。具体而言,我们通过从现有数据集中筛选 30 万个问题并在每一步进行 rollout 来估计达到正确最终答案的概率,构建了 PRM-BAS-300k 数据集。然后结合价值损失用于绝对动作质量和排序损失用于相对动作质量训练 PRM。对挑战性的多模态推理基准进行了大量实验,结果表明 PRM-BAS 在保持低计算成本的同时显著提升了推理性能。此外,它在不同模型规模和体系结构之间具有良好的可迁移性,展现出强大的鲁棒性和即插即用能力。

关键词

引用

@article{arxiv.2504.10222,
  title  = {PRM-BAS: Enhancing Multimodal Reasoning through PRM-guided Beam Annealing Search},
  author = {Pengfei Hu and Zhenrong Zhang and Qikai Chang and Shuhang Liu and Jiefeng Ma and Jun Du and Jianshu Zhang and Quan Liu and Jianqing Gao and Feng Ma and Qingfeng Liu},
  journal= {arXiv preprint arXiv:2504.10222},
  year   = {2025}
}