中文

RLPF:基于预测反馈的强化学习用于 LLM 用户摘要

计算与语言 2025-01-20 v2 人工智能 机器学习

摘要

LLM 驱动的个人化代理系统使用大型语言模型 (LLM) 从用户过去的活动中预测用户行为。然而,其有效性往往取决于能够有效地利用因其固有的噪声和数据长度而产生的大量长期用户历史数据。现有的预训练 LLM 可能生成简洁但缺乏下游任务所需上下文的摘要,阻碍其在个人化系统中的实用性。为解决这些挑战,我们引入基于预测反馈的强化学习 (RLPF)。RLPF 对 LLM 进行微调,以生成针对下游任务性能优化的简洁、人类可读的用户摘要。通过最大化生成摘要的有用性,RLPF 有效地在保留下游任务关键信息的同时,从长时间的用户历史数据中提炼出精要信息。我们的实证评估表明,RLPF 在下游任务效用和摘要质量方面均实现了显著提升,下游任务性能相较于基线方法提升最高可达22%,在事实性、抽象性和可读性方面获胜率最高可达84.59%。RLPF 还实现了上下文长度削减74%,并在16个中未见任务/数据集中提升性能,凸显其泛化能力。该方法为增强 LLM 个人化能力提供了一条前景的解决方案,通过有效地将长且嘈杂的用户历史转化为信息丰富且人类可读的表征。

关键词

引用

@article{arxiv.2409.04421,
  title  = {RLPF: Reinforcement Learning from Prediction Feedback for User Summarization with LLMs},
  author = {Jiaxing Wu and Lin Ning and Luyang Liu and Harrison Lee and Neo Wu and Chao Wang and Sushant Prakash and Shawn O'Banion and Bradley Green and Jun Xie},
  journal= {arXiv preprint arXiv:2409.04421},
  year   = {2025}
}

备注

AAAI 2025