中文

扩散偏好标注:高效 LLM 对齐的直接偏好判断

机器学习 2025-03-05 v2 人工智能 计算与语言

摘要

将大型语言模型(LLMs)与人类偏好对齐成为获取最先进性能的关键组件,但会产生巨大的成本来构建大型的人类标注偏好数据集。为解决此问题,我们提出一种新框架,即基于直接偏好判断的扩散偏好标注(SPA),仅使用极少量的人类标注偏好数据即可提升 LLM 的对齐程度。我们的核心思想是利用小(种子)数据中内置的人类先验知识,逐步改进 LLM 的对齐程度,通过迭代生成响应并从自标注偏好数据中学习。具体而言,我们提出从 LLM 的 logits 中推导偏好标签,以显式提取模型固有的偏好。与使用外部奖励模型或隐式情境学习的先前方法相比,我们观察到所提议的方法显著更有效。此外,我们引入一种噪声感知的偏好学习算法以缓解生成偏好数据中低质量的风险。我们的实验结果表明,所提议的框架显著提升了 LLM 的对齐程度。例如,我们仅使用 Ultrafeedback 数据中 3.3% 的ground-truth 偏好标签即可在 AlpacaEval 2.0 上实现优于使用完整数据或最先进基线方法的对齐性能。

关键词

引用

@article{arxiv.2406.04412,
  title  = {Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment},
  author = {Dongyoung Kim and Kimin Lee and Jinwoo Shin and Jaehyung Kim},
  journal= {arXiv preprint arXiv:2406.04412},
  year   = {2025}
}

备注

ICLR 2025 Oral Presentation, 22 pages