SciDQA:面向科学论文的深度阅读理解数据集
计算与语言
2024-11-11 v1
摘要
科学文献通常内容密集,需要大量背景知识和深度理解才能有效阅读。我们引入SciDQA,一个新的阅读理解数据集,挑战LLM对科学文章的深度理解,包含2,937个问答对。与其他科学QA数据集不同,SciDQA的问题来源于领域专家的同行评审,答案来自论文作者,确保了对文献的全面考查。我们通过仔细过滤低质量问题、脱离上下文的内容、跟踪不同版本的源文档以及纳入参考文献以支持多文档问答等过程来提升数据集质量。SciDQA中的问题需要跨越图表、表格、公式、附录和补充材料进行推理,并要求多文档推理。我们对多种开源和专有LLM在不同配置下进行了评估,以探索其生成相关且事实性回答的能力。基于表面相似度和LLM判断的综合评估揭示了显著的性能差异。SciDQA是一个经过严格筛选、自然衍生的科学QA数据集,旨在促进复杂科学文本理解的研究。
引用
@article{arxiv.2411.05338,
title = {SciDQA: A Deep Reading Comprehension Dataset over Scientific Papers},
author = {Shruti Singh and Nandan Sarkar and Arman Cohan},
journal= {arXiv preprint arXiv:2411.05338},
year = {2024}
}
备注
18 pages, Accepted to EMNLP 2024