中文

ReasonTabQA:来自真实工业场景的全方位表格问答基准

计算与语言 2026-01-13 v1

摘要

近期大型语言模型(LLM)的快速发展显著推动了基于表格的问答(TableQA)。然而,现有的TableQA基准常常忽视工业场景的细微差异,这些场景以多表格结构、嵌套标题和大规模为特征。这些环境需要通过深层结构推理来实现稳健的表格推理,这一挑战在当前方法中尚未得到充分解决。为填补这一差距,我们提出ReasonTabQA,一个涵盖30个行业领域(如能源和汽车)的大型双语基准,包含1,932个表格。ReasonTabQA为两种思考范式(思考与非思考)提供高质量的答案和显式推理链注释。此外,我们引入TabCodeRL,这是一种利用表格感知可验证奖励引导生成逻辑推理路径的强化学习方法。在ReasonTabQA和4个TableQA数据集上的大量实验表明,虽然TabCodeRL在开源LLM上取得显著的性能提升,但在ReasonTabQA上的持久性能差距仍然凸显了真实世界工业TableQA的内在复杂性。

关键词

引用

@article{arxiv.2601.07280,
  title  = {ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios},
  author = {Changzai Pan and Jie Zhang and Kaiwen Wei and Chenshuo Pan and Yu Zhao and Jingwang Huang and Jian Yang and Zhenhe Wu and Haoyang Zeng and Xiaoyan Gu and Weichao Sun and Yanbo Zhai and Yujie Mao and Zhuoru Jiang and Jiang Zhong and Shuangyong Song and Yongxiang Li and Zhongjiang He},
  journal= {arXiv preprint arXiv:2601.07280},
  year   = {2026}
}