自动化跨文档多跳科学问答生成
计算与语言
2026-03-17 v1
摘要
现有自动科学问答生成研究主要聚焦于单文档事实类问答,忽视了科学理解中至关重要的跨文档推理。我们提出 AIM-SciQA,一个用于生成多文档、多跳科学问答数据集的自动化框架。AIM-SciQA 使用大语言模型(LLM)进行机器阅读理解,提取单跳问答;并基于嵌入式语义对齐构建跨文档关系, selectively 利用引用信息。应用于 8,211 篇 PubMed Central 论文,生成 411,409 个单跳问答和 13,672 个多跳问答,构成 IM-SciQA 数据集。人类和自动验证均确认高事实一致性,实验结果表明 IM-SciQA 能有效区分检索和问答阶段的推理能力,为检索增强的科学推理提供了真实且可解释的基准。我们进一步将此框架扩展为 CIM-SciQA,即受引导的变体,实现了与 Oracle 设置相当的性能,强化了数据集的有效性和普适性。
引用
@article{arxiv.2603.14257,
title = {Automatic Inter-document Multi-hop Scientific QA Generation},
author = {Seungmin Lee and Dongha Kim and Yuni Jeon and Junyoung Koh and Min Song},
journal= {arXiv preprint arXiv:2603.14257},
year = {2026}
}
备注
14 pages, 5 figures, 8 tables. Accepted to the 2026 International Conference on Language Resources and Evaluation (LREC 2026)