SCITAT:涵盖多种推理类型的科学表格与文本问答基准
计算与语言
2024-12-17 v1
摘要
科学问答(SQA)是一项旨在基于论文回答问题的重要任务。然而,当前的SQA数据集推理类型有限,且忽略了表格与文本之间的相关性,与现实场景存在显著差距。为应对这些挑战,我们提出了一个涵盖多种推理类型的科学表格与文本问答基准(SciTaT)。为覆盖更多推理类型,我们从现实世界的问题中总结了多种推理类型。为同时涉及表格和文本,我们要求问题尽可能多地结合表格和文本。基于SciTaT,我们提出了一个强基线(CaR),它结合了多种推理方法以处理不同的推理类型,并同时处理表格和文本。CaR在SciTaT上相比其他基线平均提升了12.9%,验证了其有效性。错误分析揭示了SciTaT的挑战,例如复杂的数值计算和领域知识。
引用
@article{arxiv.2412.11757,
title = {SCITAT: A Question Answering Benchmark for Scientific Tables and Text Covering Diverse Reasoning Types},
author = {Xuanliang Zhang and Dingzirui Wang and Baoxin Wang and Longxu Dou and Xinyuan Lu and Keyan Xu and Dayong Wu and Qingfu Zhu and Wanxiang Che},
journal= {arXiv preprint arXiv:2412.11757},
year = {2024}
}