中文

通过困惑度实现少样本事实核查

计算与语言 2021-03-18 v1 机器学习

摘要

少样本学习已引起研究人员的关注,以克服数据稀缺问题。近来,大型预训练语言模型在各种下游任务(如问答和机器翻译)的少样本学习中表现出优异性能。然而,针对事实核查任务的少样本学习探索甚少。但事实核查是一个重要问题,尤其当每日在线信息量呈指数级增长时。本文中,我们提出一种通过困惑度分数利用语言模型强大迁移学习能力的新方法。我们方法最显著的优势在于其少样本学习能力。仅用两个训练样本,我们的方法在多个数据集上的 F1-Macro 指标就已绝对超过多数类基线 10% 以上。通过实验,我们经验性地验证了在事实核查语境下使用困惑度分数这一令人惊讶用法的合理性,并通过与基于强微调的基线模型比较凸显了我们少样本方法的优势。此外,我们构建并公开发布了两个与 COVID-19 相关的新事实核查数据集。

关键词

引用

@article{arxiv.2103.09535,
  title  = {Towards Few-Shot Fact-Checking via Perplexity},
  author = {Nayeon Lee and Yejin Bang and Andrea Madotto and Madian Khabsa and Pascale Fung},
  journal= {arXiv preprint arXiv:2103.09535},
  year   = {2021}
}

备注

Accpeted to NAACL'21