基于偏好策略优化的大语言模型自我引导
度量几何
2026-02-17 v2
摘要
通过偏好策略优化引导大型语言模型(LLM)自我发展,为在不依赖大量手动标注的情况下实现模型行为与人类偏好一致提供了可行路径。本文提出一种新颖的偏好策略优化(PbPO)框架,将学习过程表述为主策略与奖励模型(RM)之间的min-max博弈。RM 受限于从偏好数据中推导的置信集合,以确保可靠的利用。我们的在线迭代算法通过引导探索不断变化的策略,主动收集偏好数据,实现策略和RM的持续自我完善。我们提供了理论保证,建立了针对序列级RM和token级RM的高概率后悔界,展示了其在引导LLM方面的有效性。在五个基准测试上的大量实验表明,我们的方法在已有SOTA偏好优化技术中一致取得优异成绩。
引用
@article{arxiv.2511.12866,
title = {Affine chord Sobolev inequalities and radial mean bodies for functions},
author = {Fernanda M. Baêta and Xiaxing Cai},
journal= {arXiv preprint arXiv:2511.12866},
year = {2026}
}
备注
We have split the earlier version into two preprints. This update focuses on the affine version of the chord Sobolev inequalities and radial mean bodies. Some mistakes and citations have also been corrected