Panacea:通过偏好适应实现 LLMs 的 Pareto 对齐
计算与语言
2024-05-24 v2
摘要
当前的大语言模型对齐方法通常使用标量人类偏好标签。然而,这种惯例倾向于过度简化人类偏好的多维和异构性质,导致表达性降低甚至错位。本文提出了 Panacea,一种创新方法,将对齐重新构建为多维偏好优化问题。Panacea 训练单个模型,能够在线且 Pareto 最优地适应各种偏好集,而无需进一步调优。这里的一个主要挑战是使用低维偏好向量来指导模型的行为,尽管该行为由数量庞大的参数控制。为了解决这个问题,Panacea 被设计为使用基于奇异值分解 (SVD) 的低秩适应,允许偏好向量作为奇异值在线简单注入。在理论上,我们证明了在温和条件下,Panacea 能够通过常见的损失聚合方法恢复整个 Pareto 前沿。此外,我们的实验首次证明,通过各种优化方法,将单个 LLM 对齐以代表呈指数级广阔的人类偏好谱是可行的。我们的工作标志着在以可控和 Pareto 最优方式有效且高效地将模型对齐到多样且复杂的人类偏好方面迈出了一步。
引用
@article{arxiv.2402.02030,
title = {Panacea: Pareto Alignment via Preference Adaptation for LLMs},
author = {Yifan Zhong and Chengdong Ma and Xiaoyuan Zhang and Ziran Yang and Haojun Chen and Qingfu Zhang and Siyuan Qi and Yaodong Yang},
journal= {arXiv preprint arXiv:2402.02030},
year = {2024}
}