TabFact:基于表格的事实核查大规模数据集
计算与语言
2020-06-16 v5 人工智能
摘要
验证文本假设是否基于给定证据成立的问题,亦称事实核查,在自然语言理解与语义表示研究中具有重要作用。然而,现有研究主要局限于处理非结构化证据(如自然语言句子与文档、新闻等),而在表格、图与数据库等结构化证据下的核查仍待探索。本文专门研究以半结构化数据为证据的的事实核查。为此,我们构建了名为 TabFact 的大规模数据集,以 16k 个维基百科表格作为证据,对应 118k 条人工标注的自然语言陈述,标注为 ENTAILED(蕴含)或 REFUTED(反驳)。TabFact 具有挑战性,因其同时涉及软语言推理与硬符号推理。为应对这些推理挑战,我们设计了两种不同模型:Table-BERT 与隐式程序算法(LPA)。Table-BERT 利用最先进的预训练语言模型将线性化表格与陈述编码为连续向量以进行核查。LPA 将陈述解析为程序并对表格执行以获得返回的二值用于核查。两种方法准确率相近,但仍远落后于人类表现。我们还进行了综合分析以展示巨大的未来机遇。该数据集的数据与代码见 \url{https://github.com/wenhuchen/Table-Fact-Checking}。
引用
@article{arxiv.1909.02164,
title = {TabFact: A Large-scale Dataset for Table-based Fact Verification},
author = {Wenhu Chen and Hongmin Wang and Jianshu Chen and Yunkai Zhang and Hong Wang and Shiyang Li and Xiyou Zhou and William Yang Wang},
journal= {arXiv preprint arXiv:1909.02164},
year = {2020}
}
备注
Accepted to ICLR 2020, 17 pages, 15 figures. Main paper has 9 pages