中文

锚定偏好优化与对比修订:解决对齐中的不完整指定问题

机器学习 2024-09-17 v5 人工智能 计算与语言

摘要

大型语言模型(LLM)通常使用对比式对齐目标和偏好配对数据集进行对齐。模型、配对数据和目标之间的相互作用使得对齐过程变得复杂,有时会产生不理想的结果。我们研究了这一问题,发现:(i)当底层响应具有对比性时,偏好数据提供更好的学习信号;(ii)当对齐目标在训练期间对模型施加更多控制时,表现更好。基于这些见解,我们提出了对比式从 AI 修订中学习(CLAIR),一种导致更具对比性偏好配对的数据创建方法,以及锚定偏好优化(APO),一种可控且更稳定的对齐目标。我们使用 various 可比较数据集和对齐目标对 Llama-3-8B-Instruct 进行对齐,并测量 MixEval-Hard 分数,该分数与人类判断高度相关。CLAIR 偏好在所有数据集中表现最佳,APO 持续优于不可控的目标。我们最好的模型在 32K CLAIR 偏好上使用 APO 训练,相较于 Llama-3-8B-Instruct 提升了 7.65%,缩小了与 GPT4-turbo 的差距 45%。我们的代码可在 https://github.com/ContextualAI/CLAIR_and_APO 提供。

关键词

引用

@article{arxiv.2408.06266,
  title  = {Anchored Preference Optimization and Contrastive Revisions: Addressing Underspecification in Alignment},
  author = {Karel D'Oosterlinck and Winnie Xu and Chris Develder and Thomas Demeester and Amanpreet Singh and Christopher Potts and Douwe Kiela and Shikib Mehri},
  journal= {arXiv preprint arXiv:2408.06266},
  year   = {2024}
}