中文

Aligners:解耦LLM与对齐

计算与语言 2024-10-07 v4 人工智能 机器学习

摘要

大型语言模型(LLM)需要与人类期望对齐,以确保其在大多数应用中的安全性和实用性。对齐具有挑战性且成本高昂,并且需要针对每个LLM和对齐标准重复进行。我们提议通过训练对齐器模型来解耦LLM与对齐,这些模型可根据给定标准按需对齐任何LLM,从而也减少对齐对性能的潜在负面影响。我们训练对齐器模型的方法仅依赖于由(提示)LLM生成的合成数据,并且可以轻松调整以适应各种对齐标准。我们使用相同的合成数据来训练检查器,即二元未对齐分类模型,以引导由多个对齐器组成的“小队”。我们的实证结果表明,在多个指令遵循和红队测试数据集上,将对齐器小队应用于各种LLM(包括经对话对齐的模型)均取得了一致的改进。

关键词

引用

@article{arxiv.2403.04224,
  title  = {Aligners: Decoupling LLMs and Alignment},
  author = {Lilian Ngweta and Mayank Agarwal and Subha Maity and Alex Gittens and Yuekai Sun and Mikhail Yurochkin},
  journal= {arXiv preprint arXiv:2403.04224},
  year   = {2024}
}

备注

Short version accepted as a Tiny Paper at the International Conference on Learning Representations (ICLR) 2024. Long version accepted to the Conference on Empirical Methods in Natural Language Processing (EMNLP) 2024 Findings