中文

大型语言模型策略对齐的信息论保证

机器学习 2024-06-11 v1 信息论 math.IT 机器学习

摘要

大型语言模型的策略对齐指受约束的策略优化,即策略被优化以最大化奖励,同时保持与参考策略在f f -divergence(如KL\mathsf{KL}散度)方面的接近性。最佳n n 对齐策略从n n 个独立抽样的参考策略中选择奖励最大的样本。对于这两种情况(策略对齐和最佳n n ),最近的工作在实证上表明,对齐后策略在参考策略上的奖励改进按KL\sqrt{\mathsf{KL}}比例扩展,针对最佳n n 策略给出了对KL\mathsf{KL}的明确n n 上界。我们在本文中表明,如果参考策略下的奖励具有次高斯尾部,则KL \sqrt{\mathsf{KL}}信息论上界成立。此外,我们证明对于最佳n n 策略,任何f f -divergence的KL\mathsf{KL}上界都可以通过对指数阶统计量的归约实现,这归因于R\'enyi表示的阶统计量和数据处理不等式。 如果对对齐后策略的尾部信息有额外了解,我们表明通过R\'enyi散度可获得对奖励改进的更紧致控制。最后我们展示了这些上界如何从代理奖励转移到金标奖励,这导致由于代理奖励的过估计和近似误差,金标奖励改进会降低。

关键词

引用

@article{arxiv.2406.05883,
  title  = {Information Theoretic Guarantees For Policy Alignment In Large Language Models},
  author = {Youssef Mroueh},
  journal= {arXiv preprint arXiv:2406.05883},
  year   = {2024}
}