中文

Aligner:基于学习纠正的高效对齐方法

计算与语言 2024-11-05 v5 人工智能 机器学习

摘要

随着大语言模型(LLMs)的快速发展以及实际需求的不断演变,寻找高效且有效的对齐方法变得前所未有地重要。然而,当前对齐方法的复杂性与部署场景中快速迭代需求之间的矛盾, necessitates 开发一种能够在这些约束下运行的模型无关的对齐方法。本文介绍了 Aligner,一种新颖且简单的对齐范式,它使用一个小模型学习偏好回答与非偏好回答之间的纠正残差。Aligner 被设计为模型无关、即插即用的模块,只需一次性训练即可直接应用于各种开源和基于 API 的模型,使其适合快速迭代。值得注意的是,Aligner 可应用于任何强大的大规模上游模型。此外,它甚至可以使用纠正后的响应作为合成人类偏好数据,迭代地自举上游模型,突破模型的性能上限。我们的实验表明,在 11 个不同的 LLM 上部署相同的 Aligner 模型,并在 3H 维度(helpfulness, harmlessness, and honesty)上进行评估,均实现了性能提升。具体而言,在所有受测 LLM 上,Aligner-7B 在 helpfulness 上平均提升了 68.9%,在 harmlessness 上提升了 23.8%,同时有效减少了幻觉。在 Alpaca-Eval 排行榜上,将 Aligner-2B 叠加于 GPT-4 Turbo 使其 LC Win Rate 从 55.0% 提升至 58.3%,超越了 GPT-4 Omni 57.5% 的 Win Rate(社区报告)。

关键词

引用

@article{arxiv.2402.02416,
  title  = {Aligner: Efficient Alignment by Learning to Correct},
  author = {Jiaming Ji and Boyuan Chen and Hantao Lou and Donghai Hong and Borong Zhang and Xuehai Pan and Juntao Dai and Tianyi Qiu and Yaodong Yang},
  journal= {arXiv preprint arXiv:2402.02416},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024 Oral Presentation