语言模型对齐的理论极限
机器学习
2026-05-11 v1 计算与语言
计算机与社会
信息论
math.IT
摘要
语言模型(LM)对齐旨在提升模型输出以反映人类偏好,同时保持 base 模型的能力。最常见的对齐方法包括(i)强化学习,通过KL散度约束最大化期望奖励,和(ii)从N个独立抽样中选择最高奖励输出的best-of-N对齐。尽管这些方法广泛使用,但在KL预算下实现的奖励提升的根本极限仍不清晰。我们刻画KL正则化对齐的信噪比极限,通过推导固定KL散度预算下可实现的最大期望奖励增益。我们的第一个结果提供optimal reward improvement的闭式表达式,由Jeffreys散度项主导,而非先前分析中使用的√KL。我们进一步将该表达式重新表述为base模型下的协�变量,得到一种实用的估计器,仅从base模型抽样即可预测可实现的对齐增益。我们扩展分析至 proxy reward设置,表明在KL惩罚系数减小时,ideal对齐与proxy对齐(奖励作弊)之间的差距随奖励误差幅度而增大。我们进一步证明,奖励集成可缓解奖励作弊,为实践中使用的此技术提供了理论依据。我们在两个任务上计算LM的KL-奖励Pareto前沿(分别为安全和摘要任务),表明best-of-N接近理论极限,而PPO和GRPO则明显次之。我们的理论结果阐明了对齐文献中若干经验观察现象,并表明若不高推理成本,需需算法改进才能实现optimal对齐。
关键词
引用
@article{arxiv.2605.07105,
title = {Theoretical Limits of Language Model Alignment},
author = {Lucas Monteiro Paes and Natalie Mackraz and Barry-John Theobald and Federico Danieli},
journal= {arXiv preprint arXiv:2605.07105},
year = {2026}
}