通过上下文赌博机优化用户画像以实现检索增强的 LLM 个性化
计算与语言
2026-04-23 v2 信息检索
摘要
大型语言模型 (LLMs) 在通用任务上表现出色,但使其响应适应个体用户仍然具有挑战性。检索增强通过以用户历史记录为条件来影响 LLM,为微调提供了一种轻量级替代方案,现有方法通常基于语义相关性来选择这些记录。我们认为,相关性作为效用的代理是不可靠的:一条记录可能在语义上与查询相似,但由于冗余或冲突信息,却无法提高生成质量,甚至可能降低质量。为了弥合这一差距,我们提出了 PURPLE,一个为 LLM 个性化优化用户画像 (UseR Profiles) 的上下文赌博机框架。与贪婪地选择最相关的记录不同,PURPLE 将画像构建视为一个顺序敏感的生成过程,并利用 Plackett-Luce 排序模型来捕捉记录间复杂的依赖关系。通过使用参考响应的似然提供的语义丰富的反馈进行训练,我们的方法将检索直接与生成质量对齐。在九个个性化任务上的大量实验表明,PURPLE 在有效性和效率上均持续优于强大的启发式方法和检索增强基线,为优化用户画像建立了一个原则性强且可扩展的解决方案。
引用
@article{arxiv.2601.12078,
title = {Optimizing User Profiles via Contextual Bandits for Retrieval-Augmented LLM Personalization},
author = {Linfeng Du and Ye Yuan and Zichen Zhao and Fuyuan Lyu and Emiliano Penaloza and Xiuying Chen and Zipeng Sun and Jikun Kang and Laurent Charlin and Xue Liu and Haolun Wu},
journal= {arXiv preprint arXiv:2601.12078},
year = {2026}
}
备注
Accepted to ACL 2026