AraStance:用于事实核查的阿拉伯语立场检测多国家多领域数据集
计算与语言
2021-05-19 v2
摘要
随着线上错误信息与虚假信息的持续传播,以支持多种语言的自动化系统形式大规模开发对抗机制愈发重要。一个受关注的任务是声明真实性预测,可利用针对在线检索相关文档的立场检测来解决。为此,我们提出了新的阿拉伯语立场检测数据集(AraStance),包含来自多样来源的 4,063 对声明-文章,来源包括三家事实核查网站与一家新闻网站。AraStance 涵盖来自多个领域(如政治、体育、健康)与若干阿拉伯国家的虚假与真实声明,且在声明相关与不相关文档间均衡分布。我们使用若干基于 BERT 的模型对 AraStance 及另外两个立场检测数据集进行基准测试。我们的最佳模型达到 85% 准确率与 78% 宏 F1 分数,仍存在改进空间,并反映出 AraStance 及一般立场检测任务的挑战性。
引用
@article{arxiv.2104.13559,
title = {AraStance: A Multi-Country and Multi-Domain Dataset of Arabic Stance Detection for Fact Checking},
author = {Tariq Alhindi and Amal Alabdulkarim and Ali Alshehri and Muhammad Abdul-Mageed and Preslav Nakov},
journal= {arXiv preprint arXiv:2104.13559},
year = {2021}
}
备注
Accepted to the 2021 Workshop on NLP4IF: Censorship, Disinformation, and Propaganda