中文

FanOutQA:面向大型语言模型的多跳多文档问答基准

计算与语言 2024-06-07 v2 人工智能

摘要

日常生活中常见的一类问题是“扇出”(fan-out)问题,即复杂的、需要查找大量实体信息的多跳多文档推理问题。然而,目前很少有资源用于评估大型语言模型在此类问答能力上的表现。为了更全面地评估大型语言模型中的复杂推理能力,我们提出了 FanOutQA,这是一个高质量的扇出问题 - 答案对数据集,包含人工标注的分解步骤,并以英文维基百科为知识库。我们在数据集中构建了三种基准设置,并对包括 GPT-4、LLaMA 2、Claude-2.1 和 Mixtral-8x7B 在内的 7 个大语言模型进行了基准测试,发现当代模型在长上下文中的跨文档依赖推理方面仍有改进空间。我们提供了数据集和开源工具以运行模型,鼓励在 https://fanoutqa.com 进行评估。

关键词

引用

@article{arxiv.2402.14116,
  title  = {FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language Models},
  author = {Andrew Zhu and Alyssa Hwang and Liam Dugan and Chris Callison-Burch},
  journal= {arXiv preprint arXiv:2402.14116},
  year   = {2024}
}

备注

18 pages, 2 figures. ACL 2024