中文

线性对齐:一种无需微调与反馈即可对齐人类偏好的闭式解

计算与语言 2024-07-03 v3

摘要

基于语言模型(LLM)的 AI 助手的成功取决于基于人类反馈的强化学习(RLHF),以理解并对齐用户意图。然而,诸如 PPO 等传统对齐算法受到复杂标注和训练要求的阻碍。这种依赖限制了 RLHF 的适用性,并阻碍了针对多样化人类偏好量身定制的专业助手的发展。在本工作中,我们引入了 \textit{Linear Alignment},这是一种新颖的算法,仅需单次推理步骤即可将语言模型与人类偏好对齐,消除了对数据标注和模型训练的依赖。线性对齐在散度约束下引入了一种新的策略优化参数化方法,从而能够以闭式方式提取最优策略,并促进对齐响应的直接估计。在通用和个性化偏好数据集上的大量实验表明,线性对齐在多样化场景中显著提升了 LLM 对齐的性能与效率。我们的代码和数据集已发布于 \url{https://github.com/Wizardcoast/Linear_Alignment.git}。

关键词

引用

@article{arxiv.2401.11458,
  title  = {Linear Alignment: A Closed-form Solution for Aligning Human Preferences without Tuning and Feedback},
  author = {Songyang Gao and Qiming Ge and Wei Shen and Shihan Dou and Junjie Ye and Xiao Wang and Rui Zheng and Yicheng Zou and Zhi Chen and Hang Yan and Qi Zhang and Dahua Lin},
  journal= {arXiv preprint arXiv:2401.11458},
  year   = {2024}
}

备注

Accepted by ICML2024, I'm still preparing a better vision