中文

校正 KL 正则化的神话:基于卡方偏好优化的直接对齐

高能物理 - 理论 2024-10-18 v2 广义相对论与量子宇宙学

摘要

语言模型对齐方法,如强化学习从人类反馈(RLHF),已带来语言模型能力的显著进步,但受到一种广泛观察到的现象的限制,称为过度优化,即语言模型在对齐过程中质量下降。当模型针对离线奖励模型优化性能时,它会对数据中不准确的地方过拟合,并偏离受数据覆盖的首选响应。为抑制这种分布迁移,KL 正则化在现有离线对齐方法中广泛采用,但仍会对过度优化造成伤害。辅以理论视角阐释这些经验观察的根源,首先我们展示 KL 正则化 insufficient to prevent overfitting,然后提出问题:是否存在一种高效算法能够在理论上对抗过度优化?我们通过一种新型离线对齐算法 χ2\chi^2-偏好优化(χ\chiPO)来回答此问题。χ\chiPO 是对直接偏好优化(DPO;Rafailov 等,2023)的一个改动,仅涉及修改 DPO 目标中的对数链接函数。尽管仅需的改动极小,χ\chiPO 隐式地通过 χ2\chi^2-散度实现不确定性面对的乐观原则——χ2\chi^2-散度比 KL 正则化更有效地量化不确定性——并在理论上证明其有效缓解了过度优化,实现基于单策略集中性的样本复杂度保证——这是离线强化学习的金标准。χ\chiPO 的简单性和强大保证使其成为首个在理论上对抗过度优化的实用且通用的离线对齐算法。

关键词

引用

@article{arxiv.2407.13398,
  title  = {Supersymmetric Black Hole Hair and AdS_3 x S^3},
  author = {Subhodip Bandyopadhyay and Yogesh K. Srivastava and Amitabh Virmani},
  journal= {arXiv preprint arXiv:2407.13398},
  year   = {2024}
}

备注

v1: 25 pages, no figures; v2: 26 pages, no figures, minor changes, version to appear in JHEP