Aligners:解耦LLM与对齐
计算与语言
2024-10-07 v4 人工智能
机器学习
摘要
大型语言模型(LLM)需要与人类期望对齐,以确保其在大多数应用中的安全性和实用性。对齐具有挑战性且成本高昂,并且需要针对每个LLM和对齐标准重复进行。我们提议通过训练对齐器模型来解耦LLM与对齐,这些模型可根据给定标准按需对齐任何LLM,从而也减少对齐对性能的潜在负面影响。我们训练对齐器模型的方法仅依赖于由(提示)LLM生成的合成数据,并且可以轻松调整以适应各种对齐标准。我们使用相同的合成数据来训练检查器,即二元未对齐分类模型,以引导由多个对齐器组成的“小队”。我们的实证结果表明,在多个指令遵循和红队测试数据集上,将对齐器小队应用于各种LLM(包括经对话对齐的模型)均取得了一致的改进。
引用
@article{arxiv.2403.04224,
title = {Aligners: Decoupling LLMs and Alignment},
author = {Lilian Ngweta and Mayank Agarwal and Subha Maity and Alex Gittens and Yuekai Sun and Mikhail Yurochkin},
journal= {arXiv preprint arXiv:2403.04224},
year = {2024}
}
备注
Short version accepted as a Tiny Paper at the International Conference on Learning Representations (ICLR) 2024. Long version accepted to the Conference on Empirical Methods in Natural Language Processing (EMNLP) 2024 Findings