中文

从自然语言反馈中学习:用于个性化问答的框架

计算与语言 2026-04-27 v2 人工智能 信息检索

摘要

个性化对于提高语言技术的效果和用户满意度至关重要,尤其是在信息检索任务如问答中。当前用于个性化大型语言模型(LLM)的方法通常依赖于检索增强生成(RAG),随后使用标量奖励信号进行强化学习,以教会模型如何使用检索到的个人上下文。我们认为,这些标量奖励有时提供的是弱且非指令性的反馈,限制了学习效率和个性化质量。我们引入了VAC框架,这是一个用于个性化响应生成的新方法,取代标量奖励,改为根据用户档案和问题叙事生成的自然语言反馈(NLF)。NLF作为一种丰富且可操作的监督信号,允许策略模型不断迭代细化其输出,并内化有效的个性化策略。训练过程中,交替优化反馈模型和在改进响应上进行策略模型的微调,最终得到的策略模型在推理时无需依赖反馈。在由LaMP-QA基准测试(由三个多样化领域组成)上的评估表明,我们的方法在状态-of-the-art结果上实现了持续且显著的改进。人类评估进一步确认了生成响应的优越质量。这些结果表明,NLF为优化个性化问答提供了更有效的信号。

关键词

引用

@article{arxiv.2508.10695,
  title  = {Learning from Natural Language Feedback for Personalized Question Answering},
  author = {Alireza Salemi and Hamed Zamani},
  journal= {arXiv preprint arXiv:2508.10695},
  year   = {2026}
}