大语言模型对齐中的奖励崩塌现象
机器学习
2025-10-31 v2 人工智能
计算与语言
最优化与控制
机器学习
摘要
诸如 ChatGPT 与 GPT-4 等大型语言模型(LLM)的非凡能力,部分源于使用基于人类偏好训练的奖励模型对其进行对齐,这些偏好通常表示为对提示响应的排序。本文记录了“奖励崩塌”这一现象,即一种经验观察:在训练末期,主流的基于排序的方法导致无论提示如何,奖励分布均“完全相同”。这一结果并不可取,因为像“写一个关于你最好朋友的小故事”这样的开放式提示,其续写应产生连续范围的奖励,而像“新西兰首都是哪里”这样的具体提示应生成高或低的奖励。我们的理论研究表明,奖励崩塌主要由于基于排序的目标函数在优化中不足以纳入提示相关信息。该见解使我们能推导渐近情形下与一组效用函数相关的奖励分布的闭式表达。为克服奖励崩塌,我们引入一种提示感知优化方案,可证明在插值区间内接纳依赖提示的奖励分布。实验结果表明,我们提出的提示感知效用函数显著缓解了奖励模型训练中的奖励崩塌。
引用
@article{arxiv.2305.17608,
title = {Reward Collapse in Aligning Large Language Models},
author = {Ziang Song and Tianle Cai and Jason D. Lee and Weijie J. Su},
journal= {arXiv preprint arXiv:2305.17608},
year = {2025}
}
备注
Accepted for publication in the Journal of Data Science (JDS), reference JDS1201