中等收入国家的COVID-19疫苗错误信息
计算与语言
2023-12-20 v1 信息检索
摘要
本文介绍了一个多语言COVID-19疫苗错误信息数据集,包含来自三个中等收入国家——巴西、印度尼西亚和尼日利亚——的带标注推文。该专家策划的数据集包含5,952条推文的标注,评估其与COVID-19疫苗的相关性、是否存在错误信息以及错误信息的主题。为应对领域特异性、低资源环境和数据不平衡带来的挑战,我们采用两种方法来开发COVID-19疫苗错误信息检测模型:领域特定预训练和使用大语言模型进行文本增强。我们最佳的 misinformation 检测模型相比基线模型在宏F1分数上提升了2.7至15.9个百分点。此外,我们将错误信息检测模型应用于2020至2022年间三国1,900万条未标注推文的大规模研究,展示了我们的数据集和模型在多个国家与语言中检测和分析疫苗错误信息的实际应用。我们的分析表明,新增COVID-19病例数的百分比变化与巴西和印度尼西亚的COVID-19疫苗错误信息的比率呈交错式的正相关,且三国间的错误信息比率存在显著的正相关。
引用
@article{arxiv.2311.18195,
title = {COVID-19 Vaccine Misinformation in Middle Income Countries},
author = {Jongin Kim and Byeo Rhee Bak and Aditya Agrawal and Jiaxi Wu and Veronika J. Wirtz and Traci Hong and Derry Wijaya},
journal= {arXiv preprint arXiv:2311.18195},
year = {2023}
}
备注
Accepted to EMNLP 2023 (Main conference), 9 pages, 5 figures