SCITAB:面向科学表格组合推理与声明验证的具有挑战性基准
计算与语言
2023-10-24 v3 人工智能
摘要
当前的科学事实核查基准存在若干缺陷,例如众包声明带来的偏差以及对基于文本证据的过度依赖。我们提出 SCITAB,一个由 1.2K 专家验证的科学声明组成的具有挑战性的评估数据集,这些声明 1)源自真实的科学出版物,且 2)验证需要组合推理。声明与带有标签的含证据科学表格配对。通过广泛评估,我们证明 SCITAB 对包括基于表的预训练模型与大型语言模型在内的前沿模型构成了显著挑战。除 GPT-4 外,所有模型的表现仅略高于随机猜测。流行的提示技术(如 Chain-of-Thought)在 SCITAB 上未带来明显性能提升。我们的分析揭示了 SCITAB 带来的若干独特挑战,包括表格接地、声明歧义与组合推理。我们的代码与数据公开于 https://github.com/XinyuanLu00/SciTab。
引用
@article{arxiv.2305.13186,
title = {SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables},
author = {Xinyuan Lu and Liangming Pan and Qian Liu and Preslav Nakov and Min-Yen Kan},
journal= {arXiv preprint arXiv:2305.13186},
year = {2023}
}
备注
Accepted at EMNLP 2023 (main conference, long paper)