中文

请勿传谣!面向多印度语言 COVID 假推文检测的方法

计算与语言 2020-10-15 v1 机器学习 社会与信息网络

摘要

当前全球大流行 COVID-19 所造成的突如其来的广泛威胁对我们的生命产生了前所未有的影响。人类正经历着前所未有的巨大恐惧以及对社交媒体如往常般的依赖。恐惧不可避免地导致恐慌、猜测和错误信息的传播。许多政府已采取措施遏制此类错误信息传播以维护公共福祉。除全球措施外,为实现有效触达,针对人口统计上本地语言的处理系统在此努力中发挥着重要作用。为此,我们提出了一种方法,用于早期从社交媒体(如推文)中检测关于 COVID-19 的假新闻,涵盖英语之外的多种印度语言。此外,我们还创建了用于假新闻检测的印地语和孟加拉语推文标注数据集。我们提出了一种基于 BERT 的模型,并辅以从 Twitter 提取的额外相关特征来识别假推文。为将我们的方法扩展至多种印度语言,我们采用在印地语和孟加拉语所创建数据集上微调的 mBERT 基于模型。我们还提出了一种零样本学习方法来缓解此类低资源语言的数据稀缺问题。通过严谨实验,我们表明我们的方法在假推文检测中达到约 89% 的 F-Score,超越了当前最优(SOTA)结果。此外,我们为印地语和孟加拉语两种印度语言建立了首个基准。利用我们的标注数据,我们的模型在印地语中达到约 79% F-Score,在孟加拉语推文中达到 81% F-Score。我们的零样本模型在没有任何标注数据的情况下,于印地语中达到约 81% F-Score,在孟加拉语推文中达到 78% F-Score,这清楚地表明了我们所提方法的有效性。

关键词

引用

@article{arxiv.2010.06906,
  title  = {No Rumours Please! A Multi-Indic-Lingual Approach for COVID Fake-Tweet Detection},
  author = {Debanjana Kar and Mohit Bhardwaj and Suranjana Samanta and Amar Prakash Azad},
  journal= {arXiv preprint arXiv:2010.06906},
  year   = {2020}
}

备注

6 pages, 4 figures