中文

DEEPAMBIGQA:用于基准测试 LLM 回答完整性的歧义多跳问题

计算与语言 2025-11-04 v1 人工智能

摘要

集成搜索工具的大语言模型(LLM)在开放域问答(QA)中展现出强大潜力,但常常难以为复杂问题(如 "Which actor from the film Heat won at least one Academy Award?")生成完整的答案集合,这需要(1)区分多个同名电影,以及(2)在大量演员中进行推理以收集并整合证据。现有 QA 基准测试很少同时评估这两个挑战。为此,我们引入 DeepAmbigQAGen,一个自动数据生成管道,构建基于文本语料库和关联知识图的 QA 任务,生成自然且可验证的问题,系统性地嵌入名称歧义和多步推理。基于此,我们构建 DeepAmbigQA,包含 3600 个需要多跳推理的问题,其中一半需要显式名称歧义解决。实验显示,甚至最先进的 GPT-5 在歧义问题上仅实现 0.13 的精确匹配,在非歧义问题上仅为 0.21。这些发现凸显了致力于信息收集和答案完整性的更健全 QA 系统的必要性。

关键词

引用

@article{arxiv.2511.01323,
  title  = {DEEPAMBIGQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness},
  author = {Jiabao Ji and Min Li and Priyanshu Kumar and Shiyu Chang and Saloni Potdar},
  journal= {arXiv preprint arXiv:2511.01323},
  year   = {2025}
}

备注

25 pages