中文

超越单一奖励函数:多方面奖励优化的混合方法用于 MLLM 对齐

人工智能 2025-10-08 v1 计算与语言 计算机视觉与模式识别

摘要

与人类偏好相持的多模态大语言模型 (MLLM) 通常依赖于单信号、基于模型的奖励方法。此类单一奖励函数在特定领域任务的置信度校准不足,难以捕捉人类偏好多样化方面,且需要大量数据标注和奖励模型训练。在本工作中,我们提出一种混合奖励建模框架,集成互补的奖励范式:(i) 基于模型的奖励函数,通过学习从合成数据和人类反馈中预测标量或向量评分;(ii) 基于规则的奖励函数,利用领域特定启发式提供明确的正确性信号及置信度。除准确性外,我们进一步纳入多方面奖励以强制遵循指令,并引入通用的长度惩罚奖励以稳定训练并提升性能。该框架提供了一种灵活且有效的方法,通过强化学习策略优化来对齐 MLLM。我们的实验表明,应用混合和多方面奖励建模后,在不同多模态基准测试上均实现了持续的性能提升。我们最好的 3B 系列模型在一般和数学推理任务中实现约 9.5% 的总体平均提升。特别地,在数学基准测试中,该模型实现约 16% 的显著平均提升,凸显其在数学推理和问题解决方面的有效性。

关键词

引用

@article{arxiv.2510.05283,
  title  = {Beyond Monolithic Rewards: A Hybrid and Multi-Aspect Reward Optimization for MLLM Alignment},
  author = {Radha Gulhane and Sathish Reddy Indurthi},
  journal= {arXiv preprint arXiv:2510.05283},
  year   = {2025}
}