基于 in-context 偏好学习的个性化适应
机器学习
2024-10-21 v1 计算与语言
摘要
从人类反馈中进行强化学习(RLHF)是语言模型与人类偏好对齐的常用方法。然而,现有方法常忽视 individual user preferences,导致个性化效果不佳。我们提出了偏好预训练变换器(Preference Pretrained Transformer,PPT),一种利用在线用户反馈进行自适应个性化的新方法。PPT 利用变换器的 in-context learning 能力动态适应 individual preferences。我们的方法包含两个阶段:(1)离线阶段,我们使用 history-dependent loss函数训练单个 policy 模型;(2)在线阶段,模型通过 in-context learning 适应用户偏好。我们在情境 bandit 设置中展示了 PPT 的有效性,表明其在个性化适应方面优于现有方法,同时显著降低了计算成本。我们的结果表明,in-context learning 有潜力可用于大型语言模型的可扩展且高效的个性化。
引用
@article{arxiv.2410.14001,
title = {Personalized Adaptation via In-Context Preference Learning},
author = {Allison Lau and Younwoo Choi and Vahid Balazadeh and Keertana Chidambaram and Vasilis Syrgkanis and Rahul G. Krishnan},
journal= {arXiv preprint arXiv:2410.14001},
year = {2024}
}