中文

LaMP-QA:个性化长文本问答基准

计算与语言 2025-09-23 v2 信息检索 机器学习

摘要

个性化对于以用户为中心的问答系统至关重要。尽管其十分重要,但答案生成中的个性化研究相对不足。这主要是由于缺乏用于训练和评估个性化问答系统的资源。我们通过引入 LaMP-QA——一个为评估个性化长文本答案生成而设计的基准——来填补这一空白。该基准涵盖三大类别的问题:(1) 艺术与娱乐,(2) 生活方式与个人发展,以及 (3) 社会与文化,总计包含超过 45 个子类别。为评估 LaMP-QA 基准在个性化问答中的质量和潜在影响,我们进行了全面的人工和自动评估,以比较评估生成个性化响应的多种策略,并衡量其与人类偏好的一致性。此外,我们基于开源和专有大语言模型对多种非个性化和个性化方法进行了基准测试。结果表明,纳入所提供的个性化上下文可使性能提升达 39%。该基准已公开发布,以支持该领域的未来研究。

关键词

引用

@article{arxiv.2506.00137,
  title  = {LaMP-QA: A Benchmark for Personalized Long-form Question Answering},
  author = {Alireza Salemi and Hamed Zamani},
  journal= {arXiv preprint arXiv:2506.00137},
  year   = {2025}
}