个性化汤:通过事后参数合并实现个性化大语言模型对齐
计算与语言
2023-10-19 v1
摘要
尽管基于人类反馈的强化学习(RLHF)使大语言模型(LLMs)与通用的、聚合的人类偏好对齐,但对于学习多样化、个体化的视角而言它是次优的。本文中,我们研究基于个性化人类反馈的强化学习(RLPHF)问题,其中通过将对齐建模为多目标强化学习(MORL)问题,使 LLMs 与多个(有时冲突的)偏好对齐。相较于强大的单目标基线,我们展示可通过将偏好分解为多个维度来实现个性化对齐。这些维度基于用户声明为可取的个人化特征定义。本文中,我们展示它们可以分布式方式高效独立训练,并通过参数合并在事后有效结合。代码可在 https://github.com/joeljang/RLPHF 获取。
引用
@article{arxiv.2310.11564,
title = {Personalized Soups: Personalized Large Language Model Alignment via Post-hoc Parameter Merging},
author = {Joel Jang and Seungone Kim and Bill Yuchen Lin and Yizhong Wang and Jack Hessel and Luke Zettlemoyer and Hannaneh Hajishirzi and Yejin Choi and Prithviraj Ammanabrolu},
journal= {arXiv preprint arXiv:2310.11564},
year = {2023}
}
备注
Preprint