X-FACT:一个用于多语言事实核查的新基准数据集
计算与语言
2021-06-18 v1
摘要
在本工作中,我们介绍了 X-FACT:现有最大的公开多语言数据集,用于自然存在的真实世界声明的真实性核查。该数据集包含 25 种语言的短句,并由专家事实核查员标注了真实性。该数据集包含一个多语言评估基准,用于衡量域外泛化能力和多语言模型的零样本能力。利用最先进的多语言基于 transformer 的模型,我们开发了多个自动化事实核查模型,这些模型在文本声明之外,还利用了使用搜索引擎检索到的新闻报道中的附加元数据和证据。经验上,我们的最佳模型达到了约 40% 的 F-score,表明我们的数据集是评估多语言事实核查模型的一个具有挑战性的基准。
引用
@article{arxiv.2106.09248,
title = {X-FACT: A New Benchmark Dataset for Multilingual Fact Checking},
author = {Ashim Gupta and Vivek Srikumar},
journal= {arXiv preprint arXiv:2106.09248},
year = {2021}
}
备注
ACL 2021; For data and code, see https://github.com/utahnlp/x-fact/