MisRoBÆRTa:Transformer 对抗 misinformation
计算与语言
2023-04-18 v1 人工智能
摘要
Misinformation 被视为对我们民主价值观与原则的威胁。此类内容在社交媒体上的传播使社会两极分化,并通过扭曲公众认知和引发社会动荡而破坏公共话语,且缺乏传统新闻业的严谨性。Transformer 与迁移学习已被证明是多个知名自然语言处理任务的当前最优方法。本文提出 MisRoBÆRTa,一种基于 Transformer 的新型深度神经集成架构,用于 misinformation 检测。MisRoBÆRTa 利用两个 Transformer(BART 与 RoBERTa)来提升分类性能。我们还对多个 Transformer 在 misinformation 检测任务上的性能进行了基准测试与评估。为训练与测试,我们使用了一个带有 10 类标注的大型真实世界新闻文章数据集,解决了当前研究中的两个不足:将数据集规模由小扩大至大,并将假新闻检测的重点从二分类转向多分类。对于该数据集,我们人工核验了新闻文章内容以确保标注正确。实验结果表明,Transformer 在 misinformation 检测问题上的准确率受所采用的上下文学习方法、数据集规模与词汇维度显著影响。我们通过实证观察到,在仅使用单一 Transformer 的分类模型中,BART 取得最佳准确率,而 DistilRoBERTa 在微调与训练所需最少时间内取得最佳准确率。所提出的 MisRoBÆRTa 在 misinformation 检测任务上优于其他 Transformer 模型。为得出该结论,我们在两个数据集上对 MisRoBÆRTa 进行了充分的消融与敏感性测试。
引用
@article{arxiv.2304.07759,
title = {MisRoB{\AE}RTa: Transformers versus Misinformation},
author = {Ciprian-Octavian Truică and Elena-Simona Apostol},
journal= {arXiv preprint arXiv:2304.07759},
year = {2023}
}