超越英语的声明匹配以扩展全球事实核查
计算与语言
2021-06-03 v1
摘要
人工事实核查难以扩展以满足互联网的需求。在非英语语境下这一问题更加严重。在本文中,我们讨论声明匹配作为扩展事实核查的一种可能方案。我们将声明匹配定义为识别包含可由一次事实核查服务的声明的一对文本消息的任务。我们构建了一个新颖的数据集,包含 WhatsApp 热线消息和公共群消息,以及经过事实核查的声明;这些消息首先被标注为包含“类声明陈述”,然后与潜在相似项匹配并标注声明匹配。我们的数据集包含高资源(英语、印地语)和低资源(孟加拉语、马拉雅拉姆语、泰米尔语)语言的内容。我们使用知识蒸馏和一个高质量的“教师”模型来训练我们自己的嵌入模型,以解决数据集中低资源与高资源语言之间嵌入质量的失衡。我们提供了对方案性能的评估,并与基线及现有最先进的多语言嵌入模型(即 LASER 和 LaBSE)进行比较。我们证明在所有设定下我们的性能均超过 LASER 和 LaBSE。我们发布了标注数据集、代码本和训练好的嵌入模型以助进一步研究。
引用
@article{arxiv.2106.00853,
title = {Claim Matching Beyond English to Scale Global Fact-Checking},
author = {Ashkan Kazemi and Kiran Garimella and Devin Gaffney and Scott A. Hale},
journal= {arXiv preprint arXiv:2106.00853},
year = {2021}
}
备注
to appear in ACL 2021 as a long paper