中文

PASTA:基于表操作感知的句子-表格完形预训练的事实核查框架

计算与语言 2022-11-08 v1 人工智能 机器学习

摘要

事实核查近期吸引了大量研究关注,例如在新闻、营销与政策制定中,因为网上的错误信息与虚假信息能够左右人们的观点并影响其行动。尽管事实核查总体是一项困难任务,但在许多情况下,基于可靠信息表格的分析即可轻易揭穿虚假陈述。因此,基于表格的事实核查近期已成为一个重要且不断增长的研究领域。然而,由于缺乏可用于预训练语言模型(LMs)以感知常见表格操作(如聚合某一列或比较元组)的数据集,进展一直受限。为弥补这一差距,本文提出 PASTA,一种通过合成句子-表格完形问题预训练实现的基于表格的事实核查的先进(state-of-the-art)新框架。具体而言,我们设计了六类常见的句子-表格完形任务,包括过滤(Filter)、聚合(Aggregation)、最高级(Superlative)、比较(Comparative)、序数(Ordinal)与唯一(Unique),并基于这些任务从 WikiTables 合成了一个包含 120 万句子-表格对的大型语料。PASTA 使用近期预训练的 LM DeBERTaV3,并在我们的语料上进一步预训练。实验结果表明,PASTA 在两个基于表格的事实核查基准 TabFact 与 SEM-TAB-FACTS 上取得了新的最先进性能。特别是在包含多种操作的 TabFact 复杂集上,PASTA 大幅超越先前最优 4.7 个百分点(85.6% 对比 80.9%),且在小型 TabFact 测试集上 PASTA 与人类表现的差距缩小至仅 1.5 个百分点(90.6% 对比 92.1%)。

关键词

引用

@article{arxiv.2211.02816,
  title  = {PASTA: Table-Operations Aware Fact Verification via Sentence-Table Cloze Pre-training},
  author = {Zihui Gu and Ju Fan and Nan Tang and Preslav Nakov and Xiaoman Zhao and Xiaoyong Du},
  journal= {arXiv preprint arXiv:2211.02816},
  year   = {2022}
}

备注

EMNLP 2022