中文

面向长文本个性化文本生成的推理增强自训练

计算与语言 2025-01-09 v1 人工智能 信息检索

摘要

个性化文本生成需要大型语言模型 (LLM) 具备从上下文中学习的独特能力,而这些上下文在标准训练中往往不出现。鼓励 LLM 更好地利用个性化上下文以生成更符合用户期望的输出的一种方法是指示它们对用户的过去偏好、背景知识或写作风格进行推理。为实现这一目标,我们提出了面向个性化文本生成的推理增强自训练框架 (REST-PG),该框架训练 LLM 在生成响应时对个人数据进行推理。REST-PG 首先生成推理路径以训练 LLM 的推理能力,然后采用期望最大化强化自训练方式,对 LLM 进行迭代训练,基于其自身高奖励输出。我们在 LongLaMP 数据集上对 REST-PG 进行评估,该数据集包含四种多样化的个性化长文本生成任务。我们的实验表明,REST-PG 在数据集上的平均相对性能提升达 14.5%。

关键词

引用

@article{arxiv.2501.04167,
  title  = {Reasoning-Enhanced Self-Training for Long-Form Personalized Text Generation},
  author = {Alireza Salemi and Cheng Li and Mingyang Zhang and Qiaozhu Mei and Weize Kong and Tao Chen and Zhuowan Li and Michael Bendersky and Hamed Zamani},
  journal= {arXiv preprint arXiv:2501.04167},
  year   = {2025}
}