Ax-to-Grind Urdu: 面向乌尔都语虚假新闻检测的基准数据集
计算与语言
2024-03-22 v1 人工智能
摘要
错误信息会对社会产生严重影响,从公众舆论到机构信任乃至国家的政治前景无一不受其波及。在线网站和在线社交网络(OSNs)上的虚假新闻(FN)泛滥激增。各种事实核查网站主要包含英语新闻,极少提供关于区域语言FN的信息。因此,无法利用事实核查门户来甄别乌尔都语FN的传播者。虚假新闻检测(FND)的SOTA方法依赖于标注恰当且规模庞大的数据集。由于缺乏规模有限的数据集和可靠的词汇资源,区域及资源受限语言的FND发展滞后。以往用于乌尔都语FND的数据集规模有限、领域受限、不公开,且新闻由英语翻译为乌尔都语,未经人工验证。本文中,我们整理并贡献了首个规模最大的公开可用乌尔都语FND数据集Ax-to-Grind Urdu,以弥合现有文献中乌尔都语数据集的已识别缺陷与局限。该数据集包含来自巴基斯坦和印度主要且权威的乌尔都语报纸及新闻频道网站的15个领域的10083条虚假与真实新闻。Ax-to-Grind数据集的FN收集自网站和众包。该数据集包含2017年至2023年的乌尔都语新闻条目。由资深记者对数据集进行标注。我们使用mBERT、XLNet和XLM RoBERTa的集成模型对该数据集进行了基准测试。所选模型最初在多语言大型语料库上训练。所提模型的结果基于性能指标:F1分数、准确率、精确率、召回率和MCC值。
引用
@article{arxiv.2403.14037,
title = {Ax-to-Grind Urdu: Benchmark Dataset for Urdu Fake News Detection},
author = {Sheetal Harris and Jinshuo Liu and Hassan Jalil Hadi and Yue Cao},
journal= {arXiv preprint arXiv:2403.14037},
year = {2024}
}