中文

ORPO:无需参考模型的整体偏好优化

计算与语言 2024-03-15 v2 人工智能

摘要

尽管最近针对语言模型的偏好对齐算法展现出了可喜的结果,但监督微调 (SFT) 对于实现成功收敛仍是必不可少的。本文研究了 SFT 在偏好对齐背景下的关键作用,强调对不受欢迎的生成风格施加轻微惩罚即可实现偏好对齐的 SFT。在此基础上,我们引入了一种简单且创新的无参考模型的整体优势比偏好优化算法 ORPO,消除了额外偏好对齐阶段的必要性。我们从经验和理论上证明,在 125M 到 7B 的不同规模下,优势比是在 SFT 期间对比偏好和非偏好风格的合理选择。具体而言,仅在 UltraFeedback 上使用 ORPO 微调 Phi-2 (2.7B)、Llama-2 (7B) 和 Mistral (7B),便超越了参数量超过 7B 和 13B 的 SOTA 语言模型的性能:在 AlpacaEval2.0\text{AlpacaEval}_{2.0} 上达到 12.20%(图 1),在 IFEval(指令级宽松,表 6)上达到 66.19%,在 MT-Bench 上达到 7.32(图 12)。我们发布了 Mistral-ORPO-α\alpha (7B) 和 Mistral-ORPO-β\beta (7B) 的代码和模型检查点。

关键词

引用

@article{arxiv.2403.07691,
  title  = {ORPO: Monolithic Preference Optimization without Reference Model},
  author = {Jiwoo Hong and Noah Lee and James Thorne},
  journal= {arXiv preprint arXiv:2403.07691},
  year   = {2024}
}

备注

Preprint