中文

TANQ:一个开放域表格问答数据集

计算与语言 2025-04-08 v3

摘要

语言模型,可能辅以检索等工具使用,正成为回答问题的主要手段。在现实场景中理解和回答问题通常需要从不同来源检索信息,处理和聚合数据以提取见解,并以新颖的表格、图表或信息图等结构化制品的形式呈现复杂发现。在本文中,我们介绍了TANQ,这是第一个开放域问答数据集,其答案需要从多个来源的信息构建表格。我们发布了结果表格中每个单元格的完整来源归属,并在开放、oracle和封闭书设置下对最先进的语言模型进行了基准测试。我们表现最佳的基线模型Gemini Flash达到了60.7的总体F1分数,落后人类表现12.3个百分点。我们分析了基线模型在不同数据集属性上的表现,例如该任务所需的不同技能,包括多跳推理、数学运算和单位转换。我们进一步讨论了模型生成答案中的常见失败,表明TANQ是一个复杂的任务,未来面临许多挑战。

关键词

引用

@article{arxiv.2405.07765,
  title  = {TANQ: An open domain dataset of table answered questions},
  author = {Mubashara Akhtar and Chenxi Pang and Andreea Marzoca and Yasemin Altun and Julian Martin Eisenschlos},
  journal= {arXiv preprint arXiv:2405.07765},
  year   = {2025}
}

备注

12 pages, accepted at TACL