TAPAS 在 SemEval-2021 任务 9 中的表现:基于中间预训练的表格推理
计算与语言
2021-04-05 v1
摘要
我们介绍 TAPAS 对表格陈述验证与证据查找共享任务(SemEval 2021 任务 9, Wang et al. (2021))的贡献。SEM TAB FACT 任务 A 是一个分类任务,用于识别给定表格内容是否蕴含、中立或反驳某陈述。我们采用 Eisenschlos et al. (2020) 的二值 TAPAS 模型来处理该任务。我们学习两个二值分类模型:第一个模型预测陈述为中立或非中立,第二个预测其为蕴含或反驳。由于共享任务训练集仅含蕴含或反驳样本,我们生成人工中立样本以训练第一个模型。两个模型均使用 MASKLM 目标、中间反事实与合成数据(Eisenschlos et al., 2020)以及大型表格蕴含数据集 TABFACT(Chen et al., 2020)进行预训练。我们发现人工中立样本在训练第一个模型上具有一定效果,测试 F1 达 68.03,而多数类基线为 60.47。对于第二阶段,我们发现中间数据与 TABFACT 上的预训练相较 MASKLM 预训练提升了结果(68.03 对比 57.01)。
引用
@article{arxiv.2104.01099,
title = {TAPAS at SemEval-2021 Task 9: Reasoning over tables with intermediate pre-training},
author = {Thomas Müller and Julian Martin Eisenschlos and Syrine Krichene},
journal= {arXiv preprint arXiv:2104.01099},
year = {2021}
}