SciTaRC:基准测试需要语言推理与复杂计算的科学表格数据问答
计算与语言
2026-03-11 v1
摘要
我们提出SciTaRC,一个由专家构建的基准测试,涉及关于科学论文中表格数据的问题,要求深入的语言推理与复杂计算。我们表明,当前主流AI模型在这些问题中至少有23%无法解决,即便是像 Llama-3.3-70B-Instruct 这类高度可能的开源模型,也在65.5%的任务中失败。我们的分析揭示了一个普遍的'执行瓶颈':无论是代码还是语言模型,即使提供正确的策略,也难以忠实地执行计划。具体而言,基于代码的方法在原始科学表格上脆弱,而自然语言推理主要因初始理解问题和计算错误而失败。
引用
@article{arxiv.2603.08910,
title = {SciTaRC: Benchmarking QA on Scientific Tabular Data that Requires Language Reasoning and Complex Computation},
author = {Hexuan Wang and Yaxuan Ren and Srikar Bommireddypalli and Shuxian Chen and Adarsh Prabhudesai and Rongkun Zhou and Elina Baral and Philipp Koehn},
journal= {arXiv preprint arXiv:2603.08910},
year = {2026}
}
备注
18 pages, 11 figures, 7 tables