中文

BioGraphletQA:基于知识图谱生成复杂 QA 数据集

计算与语言 2026-04-30 v1

摘要

本文提出了一个原则且可扩展的框架,用于系统性地生成复杂问答 (QA) 数据。在此框架的核心是一种以图基锚点生成过程,其中来自知识图谱 (KG) 的小型子图用于结构化提示中控制问题的复杂度并确保其事实依托。该框架的第一个实例是 BioGraphletQA,一个新的生物医学知识图谱问答数据集,包含 119,856 对 QA 配对。每个条目都以最多 5 个节点的子图作为依托,大多数配对均由来自 PubMed 的相关文档片段丰富。我们通过对 106 对 QA 配对进行领域专家评估来展示框架的价值和数据集的质量,确认生成数据的科学有效性和复杂度。其次,我们通过在低资源环境下将数据增强到下游基准测试中,显示其实用价值,将 PubMedQA 的准确率从 49.2% 提升到 68.5%,在完整资源环境下将 MedQA 的准确率从 41.4% 提升到 44.8%。我们的框架为创建关键资源提供了稳健且可推广的解决方案,以推动复杂 QA 任务的发展,包括 MCQA 和 KGQA。支持本工作的所有资源,包括数据集 (https://zenodo.org/records/17381119) 和框架代码 (https://github.com/ieeta-pt/BioGraphletQA),均公开可用,以促进使用、可重复性和扩展。

关键词

引用

@article{arxiv.2604.26048,
  title  = {BioGraphletQA: Knowledge-Anchored Generation of Complex QA Datasets},
  author = {Richard A. A. Jonker and Bárbara Maria Ribeiro de Abreu Martins and Sérgio Matos},
  journal= {arXiv preprint arXiv:2604.26048},
  year   = {2026}
}

备注

15 pages, 7 figures, conference (ECIR)