FanOutQA:面向大型语言模型的多跳多文档问答基准
计算与语言
2024-06-07 v2 人工智能
摘要
日常生活中常见的一类问题是“扇出”(fan-out)问题,即复杂的、需要查找大量实体信息的多跳多文档推理问题。然而,目前很少有资源用于评估大型语言模型在此类问答能力上的表现。为了更全面地评估大型语言模型中的复杂推理能力,我们提出了 FanOutQA,这是一个高质量的扇出问题 - 答案对数据集,包含人工标注的分解步骤,并以英文维基百科为知识库。我们在数据集中构建了三种基准设置,并对包括 GPT-4、LLaMA 2、Claude-2.1 和 Mixtral-8x7B 在内的 7 个大语言模型进行了基准测试,发现当代模型在长上下文中的跨文档依赖推理方面仍有改进空间。我们提供了数据集和开源工具以运行模型,鼓励在 https://fanoutqa.com 进行评估。
引用
@article{arxiv.2402.14116,
title = {FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language Models},
author = {Andrew Zhu and Alyssa Hwang and Liam Dugan and Chris Callison-Burch},
journal= {arXiv preprint arXiv:2402.14116},
year = {2024}
}
备注
18 pages, 2 figures. ACL 2024