基于 BERT 的两阶段分类器用于 COVID-19 misinformation 检测:以印尼语推文为研究
计算与语言
2022-07-01 v1 社会与信息网络
摘要
自 2020 年初以来,COVID-19 疫情造成了全球性的重大影响。这给社会带来了大量困惑,尤其是由于社交媒体上错误信息的传播。尽管已有若干关于社交媒体数据中错误信息检测的研究,多数研究聚焦于英语数据集。印度尼西亚的 COVID-19 错误信息检测研究仍很匮乏。因此,通过本研究,我们收集并标注了印尼语数据集,并通过考虑推文相关性构建用于检测 COVID-19 错误信息的预测模型。数据集构建由一组标注员完成,他们对推文数据的相关性与错误信息进行了标注。在本研究中,我们提出使用 IndoBERT 预训练语言模型的两阶段分类器模型用于推文错误信息检测任务。我们还实验了若干其他文本分类基线模型。实验结果表明,用于相关性预测的 BERT 序列分类器与用于错误信息检测的 Bi-LSTM 的组合以 87.02% 的准确率优于其他机器学习模型。总体而言,BERT 的利用提升了多数预测模型的性能。我们发布了一个高质量的印尼语 COVID-19 错误信息推文语料库,其高标注员间一致性表明了语料质量。
引用
@article{arxiv.2206.15359,
title = {Two-Stage Classifier for COVID-19 Misinformation Detection Using BERT: a Study on Indonesian Tweets},
author = {Douglas Raevan Faisal and Rahmad Mahendra},
journal= {arXiv preprint arXiv:2206.15359},
year = {2022}
}
备注
29 pages, 5 figures, submitted to Elsevier Journal