中文

T-POP:基于在线偏好反馈的测试时个性化

机器学习 2025-09-30 v1 人工智能

摘要

将大型语言模型(LLM)个性化以适应个体用户偏好,是超越生成通用有益回复的关键一步。然而,当前的个性化方法不适用于新用户,因为它们通常需要缓慢且资源密集的微调,或大量预先存在的用户数据,从而造成了显著的冷启动问题。为了应对这一挑战,我们通过从文本生成过程中收集的在线成对偏好反馈中进行学习,引入了一种实时个性化的新范式。我们提出了 T-POP(基于在线偏好反馈的测试时个性化),这是一种将测试时对齐与对决赌博机协同结合的新颖算法。在无需更新 LLM 参数的情况下,T-POP 通过在线学习一个捕捉用户偏好的奖励函数,来引导冻结 LLM 的解码过程。通过利用对决赌博机,T-POP 智能地向用户发起查询,在探索用户偏好与利用已学知识以生成个性化文本之间高效取得平衡。大量实验表明,T-POP 实现了快速且数据高效的个性化,显著优于现有基线,并随着用户交互次数的增加表现出持续的改进。

关键词

引用

@article{arxiv.2509.24696,
  title  = {T-POP: Test-Time Personalization with Online Preference Feedback},
  author = {Zikun Qu and Min Zhang and Mingze Kong and Xiang Li and Zhiwei Shang and Zhiyong Wang and Yikun Ban and Shuang Qiu and Yao Shu and Zhongxiang Dai},
  journal= {arXiv preprint arXiv:2509.24696},
  year   = {2025}
}

备注

Preprint