中文

通过强化学习训练大语言模型以实现意图感知个性化问答

计算与语言 2026-05-14 v1 人工智能

摘要

有效的个性化问答(PQA)在语言模型中需要将响应 grounded于用户潜在意图,而意图指的是查询隐式的"为什么",超越其明确的表述。然而,现有的意图感知个性化方法依赖于多轮对话情境或丰富的用户档案,且未在推理过程中显式建模用户意图。这限制了其在单轮设置中的效果,在此情境下,用户的潜在目标必须从最小输入中推断,并整合到思考和推理过程中。为弥合这一鸿沟,我们提出IAP(Intent-Aware Personalization),一种强化学习框架,训练模型从单轮问题中推断隐式用户意图,并通过基于标签的模式将其整合到思考步骤中,以生成个性化、意图导向的答案。通过在个性化奖励函数下优化意图感知答案轨迹,IAP强化生成路径,使隐式用户意图显式化,并产生更符合用户潜在目标的响应。在LaMP-QA基准测试中进行实验,IAP在六个模型上均优于所有基线,平均宏观得分提升约7.5%,表明在训练目标中建模隐式用户意图是PQA的一个有前景的方向。

关键词

引用

@article{arxiv.2605.12645,
  title  = {Training LLMs with Reinforcement Learning for Intent-Aware Personalized Question Answering},
  author = {Maryam Amirizaniani and Benjamin Charles Germain Lee and Jevin West and Nicholas Weber},
  journal= {arXiv preprint arXiv:2605.12645},
  year   = {2026}
}