FSPO: 少样本合成偏好优化实现用户个性化
机器学习
2026-04-20 v2 人工智能
计算与语言
人机交互
机器学习
摘要
有效的 LLM 个性化对诸如虚拟助手和内容推荐等广泛的用户交互应用至关重要。灵感来自 LLM 的强大零样学习能力,我们提出了少样本偏好优化 (FSPO),这是一种用于 LLM 个性化的算法,将奖励建模重新表述为元学习问题。在 FSPO 下,LLM 可通过少量标记偏好快速推断出针对用户的个性化奖励函数。FSPO 还利用用户描述理性化 (RAT) 以鼓励更好的奖励建模和指令遵循,从而恢复与 oracle 用户描述相关的性能。由于实际偏好数据在规模上具有挑战性,本文提出了谨慎的设计选择,用于构建合成偏好数据集进行个性化,从而使用公开可用的 LLM 生成超过 100 万条合成的个性化偏好。为成功将合成数据迁移到真实用户,我们发现数据必须同时具备高多样性和连贯、自我一致的结构。我们在电影评论、教育和开放式问答等三个领域针对最多 1500 个合成用户评估 FSPO。我们还进行了受控的人类研究。总体而言,FSPO 在生成符合合成用户个性化的响应方面以 87% 的 Alpaca Eval 获胜率,在开放式问答中针对真实人类用户实现 70% 的获胜率。
引用
@article{arxiv.2502.19312,
title = {FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users},
author = {Anikait Singh and Sheryl Hsu and Kyle Hsu and Eric Mitchell and Stefano Ermon and Tatsunori Hashimoto and Archit Sharma and Chelsea Finn},
journal= {arXiv preprint arXiv:2502.19312},
year = {2026}
}
备注
Website: https://fewshot-preference-optimization.github.io/