面向个性化问答的多步检索个人上下文推理学习
计算与语言
2026-02-24 v1 人工智能
信息检索
摘要
问答中的个性化要求答案既准确又与用户的背景、偏好和历史上下文相吻合。现有的领先方法主要依赖检索增强生成(RAG)解决方案,通过检索用户档案中相关条目来构建个人上下文。现有方法直接使用用户查询检索个人文档,常导致仅实现表层级的个性化。我们提出 PR2(Personalized Retrieval-Augmented Reasoning),一种集成推理与个人上下文检索的强化学习框架。PR2 学习自适应的检索-推理策略,决定何时检索、从用户档案中检索什么证据,以及如何将其整合到中间推理步骤中。通过在个性化奖励函数下优化多轮推理轨迹,该框架强化那些更符合用户特定偏好和上下文信号的推理路径。在 LaMP-QA 基准上进行大规模实验,采用三种大语言模型(LLM)验证,PR2 consistently 超越强大基线,实现个性化问答平均提升 8.8%-12%。
引用
@article{arxiv.2602.19317,
title = {Learning to Reason for Multi-Step Retrieval of Personal Context in Personalized Question Answering},
author = {Maryam Amirizaniani and Alireza Salemi and Hamed Zamani},
journal= {arXiv preprint arXiv:2602.19317},
year = {2026}
}