中文

卢干达语—英语码混社交媒体文本中的错误信息检测

计算与语言 2021-04-06 v2 社会与信息网络

摘要

社交媒体平台上错误信息在出现频率、形式与负面影响上的增长,使得开发更多错误信息检测工具成为必要。当前已有针对 COVID-19 错误信息的工作,但针对乌干达 40 种独特本土语言中的任何一种,均尚无错误信息检测工具。本文通过呈现基于来自 Facebook 与 Twitter 社交媒体平台的卢干达语—英语码混消息的基础语言资源与错误信息检测数据集,填补了这一空白。在该错误信息检测数据集上应用若干机器学习方法,以开发用于检测一条卢干达语—英语码混消息是否含错误信息的分类模型。在实验性错误信息检测任务中对分类方法的 10 折交叉验证评估显示,判别多项朴素贝叶斯(DMNB)方法取得了最高的准确率与 F 值,分别为 78.19% 与 77.90%。此外,支持向量机与 Bagging 集成分类模型取得了可比结果。这些结果令人鼓舞,因为机器学习模型仅基于来自该错误信息检测数据集的 n-gram 特征。

关键词

引用

@article{arxiv.2104.00124,
  title  = {Misinformation detection in Luganda-English code-mixed social media text},
  author = {Peter Nabende and David Kabiito and Claire Babirye and Hewitt Tusiime and Joyce Nakatumba-Nabende},
  journal= {arXiv preprint arXiv:2104.00124},
  year   = {2021}
}

备注

Accepted at African NLP workshop @EACL 2021