大型语言模型策略对齐的信息论保证
机器学习
2024-06-11 v1 信息论
math.IT
机器学习
摘要
大型语言模型的策略对齐指受约束的策略优化,即策略被优化以最大化奖励,同时保持与参考策略在-divergence(如散度)方面的接近性。最佳对齐策略从个独立抽样的参考策略中选择奖励最大的样本。对于这两种情况(策略对齐和最佳),最近的工作在实证上表明,对齐后策略在参考策略上的奖励改进按比例扩展,针对最佳策略给出了对的明确上界。我们在本文中表明,如果参考策略下的奖励具有次高斯尾部,则信息论上界成立。此外,我们证明对于最佳策略,任何-divergence的上界都可以通过对指数阶统计量的归约实现,这归因于R\'enyi表示的阶统计量和数据处理不等式。 如果对对齐后策略的尾部信息有额外了解,我们表明通过R\'enyi散度可获得对奖励改进的更紧致控制。最后我们展示了这些上界如何从代理奖励转移到金标奖励,这导致由于代理奖励的过估计和近似误差,金标奖励改进会降低。
引用
@article{arxiv.2406.05883,
title = {Information Theoretic Guarantees For Policy Alignment In Large Language Models},
author = {Youssef Mroueh},
journal= {arXiv preprint arXiv:2406.05883},
year = {2024}
}