中文

高效个体偏好对齐:解耦偏好表征与文本生成

计算与语言 2024-12-31 v1 人工智能

摘要

与通用人类偏好对齐的大型语言模型(LLM)在提高LLM与人类交互质量方面已被证明至关重要。然而,人类价值观在不同个体之间本质上具有多样性,仅凭对通用偏好进行对齐显然不足。为此,根据个体反馈对LLM进行个性化定制的方法日益成为有前景的解决方案。然而,这一方法在对齐算法效率方面存在挑战。本文引入了一种灵活的个体偏好对齐范式。我们的方法通过在LLM中将偏好表征与文本生成彻底解耦,从根本上提高了效率。我们在多个文本生成任务上验证了该方法,表明其可以产生与PEFT类方法相当或更好的对齐质量,同时将针对每个新个体偏好所需的额外训练时间缩短80%至90%。

关键词

引用

@article{arxiv.2412.20834,
  title  = {Disentangling Preference Representation and Text Generation for Efficient Individual Preference Alignment},
  author = {Jianfei Zhang and Jun Bai and Bei Li and Yanmeng Wang and Rumei Li and Chenghua Lin and Wenge Rong},
  journal= {arXiv preprint arXiv:2412.20834},
  year   = {2024}
}

备注

Coling 2025