中文

语言模型对齐的渐近性质

机器学习 2024-04-03 v1 信息论 math.IT 机器学习

摘要

设p为生成式语言模型。设r为奖励模型,返回一个标量,表示从p中抽取的样本被偏好的程度。语言模型对齐的目标是将p改变为新的分布φ,从而获得更高的期望奖励,同时保持φ接近p。一种流行的对齐方法是KL约束强化学习(RL),它选择最大化E_{φ_Δ} r(y)的分布φ_Δ,受限于相对熵约束KL(φ_Δ || p) ≤ Δ。另一种简单的对齐方法是best-of-N,即从p中抽取N个样本,选择奖励最高的一个。在本文中,我们给出了最优KL约束RL解的闭式表征。我们证明,任何在KL散度和奖励之间实现类似权衡的对齐方法,都必须在相对熵意义上逼近最优KL约束RL解。为了进一步分析对齐方法的性质,我们引入了两个简化假设:语言模型是无记忆的,奖励模型是线性的。尽管这些假设可能无法反映复杂的现实场景,但它们能够精确刻画best-of-N对齐和KL约束RL方法在信息论量方面的渐近行为。我们证明,最优KL约束RL解的奖励满足大偏差原理,并完全刻画了其速率函数。我们还表明,奖励的缩放累积量的增长率由适当的Rényi交叉熵表征。最后,我们证明best-of-N渐近等价于KL约束RL解,因为它们的期望奖励渐近相等,并得出结论:两个分布在KL散度上必须接近。

关键词

引用

@article{arxiv.2404.01730,
  title  = {Asymptotics of Language Model Alignment},
  author = {Joy Qiping Yang and Salman Salamatian and Ziteng Sun and Ananda Theertha Suresh and Ahmad Beirami},
  journal= {arXiv preprint arXiv:2404.01730},
  year   = {2024}
}