HiTab:用于问答与自然语言生成的层次化表格数据集
计算与语言
2022-03-29 v3 信息检索
摘要
表格常带有层次结构,但现有表格推理工作主要关注扁平表格而忽视层次化表格。层次化表格通过层次化索引以及计算与语义的隐式关系对现有方法提出挑战。本工作提出 HiTab,一个免费开放的数据集,用于研究层次化表格上的问答(QA)与自然语言生成(NLG)。HiTab 是从大量统计报告(分析)和 Wikipedia 页面构建的跨域数据集,具有如下独特特征:(1) 几乎所有表格都是层次化的;(2) NLG 的目标句子与 QA 的问题均改写自报告原作者和分析人员所写原始、有意义且多样的描述性句子;(3) 为揭示统计分析中复杂的数值推理,我们提供实体与数量对齐的细粒度标注。HiTab 在 3,597 个表格上提供 10,686 个 QA 对及描述性句子,带有良好标注的量和实体对齐,广泛覆盖表格层次与数值推理类型。针对层次结构,我们设计了一种新颖的层次感知逻辑形式用于表格上的符号推理,展现出高有效性。针对复杂数值推理,我们提出基于实体与数量对齐标注的半监督训练,帮助模型大幅减少 QA 任务中的伪预测。在 NLG 任务中,我们发现实体与数量对齐也帮助 NLG 模型在条件生成设定下生成更好结果。最先进(state-of-the-art)基线的实验结果表明,该数据集提出了强劲挑战并可作为未来研究的宝贵基准。
引用
@article{arxiv.2108.06712,
title = {HiTab: A Hierarchical Table Dataset for Question Answering and Natural Language Generation},
author = {Zhoujun Cheng and Haoyu Dong and Zhiruo Wang and Ran Jia and Jiaqi Guo and Yan Gao and Shi Han and Jian-Guang Lou and Dongmei Zhang},
journal= {arXiv preprint arXiv:2108.06712},
year = {2022}
}
备注
ACL'22 main track