中文

面向多样化用户偏好的LLM算术控制:基于多目标奖励的方向性偏好对齐

机器学习 2024-03-07 v3 人工智能 计算与语言 机器学习

摘要

对大型语言模型(LLM)的细粒度控制仍然是一个重大挑战,阻碍了它们适应多样化用户需求的能力。虽然基于人类反馈的强化学习(RLHF)在对齐LLM方面显示出前景,但其对标量奖励的依赖通常限制了其在现实应用中捕捉多样化用户偏好的能力。为了解决这一限制,我们引入了方向性偏好对齐(DPA)框架。与标量奖励的RLHF不同,DPA结合了多目标奖励建模来表示多样化的偏好配置文件。此外,DPA将用户偏好建模为奖励空间中的方向(即单位向量),以实现用户依赖的偏好控制。我们的方法包括训练一个多目标奖励模型,然后使用偏好条件的拒绝采样微调(RSF)变体对LLM进行微调,RSF是Llama 2采用的RLHF方法。该方法在各种奖励目标之间实现了更好的性能权衡。与标量奖励的RLHF相比,DPA为用户提供了对LLM生成的直观控制:他们可以算术地指定所需的权衡(例如,更有帮助但更简洁)。我们还通过Mistral-7B上的实际对齐实验验证了DPA的有效性。我们的方法提供了对帮助性和简洁性之间权衡的直接算术控制,同时保持了与强基线(如直接偏好优化(DPO))竞争的性能。

关键词

引用

@article{arxiv.2402.18571,
  title  = {Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards},
  author = {Haoxiang Wang and Yong Lin and Wei Xiong and Rui Yang and Shizhe Diao and Shuang Qiu and Han Zhao and Tong Zhang},
  journal= {arXiv preprint arXiv:2402.18571},
  year   = {2024}
}

备注

The code and model are released at https://github.com/Haoxiang-Wang/directional-preference-alignment