中文

AIT-QA:航空业复杂表格上的问答数据集

计算与语言 2021-06-25 v1 人工智能

摘要

近年来,Transformer 的进展使表格问答(Table QA)系统能在 WikiTableQuestions 和 WikiSQL 等开放领域数据集上取得高精度和 SOTA 结果。此类 Transformer 常在维基百科等开放领域内容上进行预训练,能有效地对表格问答数据集中所见维基百科的问题及对应表格进行编码。然而,维基百科中的网页表格布局明显扁平,仅首行为列标题,这种布局倾向于将表格视为关系视图,其中每一行是一个元组。相比之下,领域特定的商业或科学文档中的表格通常具有复杂得多的布局,包括层级化的行与列标题,并且含有该领域的专业词汇。为解决此问题,我们引入了领域特定的表格问答数据集 AIT-QA(航空业表格问答,Airline Industry Table QA)。该数据集包含由人工标注者在 116 张表格上撰写的 515 个问题,这些表格提取自主要航空公司在 2017–2019 财年的美国 SEC 公开文件(公开地址:https://www.sec.gov/edgar.shtml)。我们还提供了关于问题性质的标注,标记出那些需要层级标题、领域术语和改写形式的问题。我们对三种基于 Transformer 的 SOTA 表格问答方法——TaPAS(端到端)、TaBERT(基于语义解析)和 RCI(基于行列编码)——进行了零样本基线评估,清晰地暴露了这些方法在此实际场景中的局限性,最佳准确率仅为 51.8%(RCI)。我们还给出了实用的表格预处理步骤,用于将这些复杂表格透视并投影为适合 SOTA 表格问答模型的布局。

关键词

引用

@article{arxiv.2106.12944,
  title  = {AIT-QA: Question Answering Dataset over Complex Tables in the Airline Industry},
  author = {Yannis Katsis and Saneem Chemmengath and Vishwajeet Kumar and Samarth Bharadwaj and Mustafa Canim and Michael Glass and Alfio Gliozzo and Feifei Pan and Jaydeep Sen and Karthik Sankaranarayanan and Soumen Chakrabarti},
  journal= {arXiv preprint arXiv:2106.12944},
  year   = {2021}
}