基于多任务迁移学习的假新闻检测本地化
计算与语言
2020-05-18 v3
摘要
互联网作为传播假新闻的快速媒介,强化了对抗假新闻的计算工具的需求。现有的假新闻分类器训练技术均假定有充足的资源,包括大型标注数据集和专家整理的语料库,而低资源语言可能不具备这些条件。本文做出两项主要贡献:首先,我们通过构建首个针对菲律宾语的专家整理假新闻检测基准数据集(称为“Fake News Filipino”)来缓解资源稀缺问题。其次,我们对迁移学习(TL)技术进行基准测试,表明其可用于从少量数据训练鲁棒的假新闻分类器,在我们的假新闻数据集上达到91%的准确率,相较已有的少样本基线将误差降低14%。此外,借鉴多任务学习的思想,我们表明用辅助语言建模损失增强基于transformer的迁移技术,可通过适应写作风格来提升性能。据此,我们将TL性能提升4-6%,最佳模型准确率达96%。最后,我们表明该方法可良好泛化至不同类型的新闻文章,包括政治新闻、娱乐新闻与评论文章。
引用
@article{arxiv.1910.09295,
title = {Localization of Fake News Detection via Multitask Transfer Learning},
author = {Jan Christian Blaise Cruz and Julianne Agatha Tan and Charibeth Cheng},
journal= {arXiv preprint arXiv:1910.09295},
year = {2020}
}
备注
Published in the LREC 2020 Proceedings. Models and data available at https://github.com/jcblaisecruz02/Tagalog-fake-news