基于 Transformer 的模型(BERT、ALBERT 与 RoBERTa)在假新闻检测中的性能分析
计算与语言
2023-08-10 v1 密码学与安全
机器学习
摘要
假新闻是以新闻媒体格式呈现的虚假材料,却未被新闻机构妥善处理。这些虚假材料可能煽动或诽谤重要实体或个人,甚至可能为创作者个人利益服务,给社会带来问题。由于领域知识有限与时间约束,区分假新闻与真实新闻颇具挑战。据调查,居民最容易遭遇骗局与错误信息的三大地区为万丹、雅加达特区和西爪哇。Transformer 模型指的是人工智能(AI)自然语言处理领域中利用深度学习架构的一种方法。Transformer 运用强大的注意力机制并行处理文本并产生丰富且具上下文的词表示。先前研究表明,名为 BERT 的 Transformer 模型性能优于非 Transformer 方法。然而,一些研究指出,使用被称为 ALBERT 与 RoBERTa 的改进 BERT 模型可提升性能。但改进的 BERT 模型在印尼语假新闻检测中尚未得到充分探索。在本研究中,我们探究了这些 Transformer 模型,发现 ALBERT 以 87.6% 准确率、86.9% 精确率、86.9% F1 分数与 174.5 运行时间(秒/轮)分别优于其他模型。源代码见:https://github.com/Shafna81/fakenewsdetection.git
引用
@article{arxiv.2308.04950,
title = {Performance Analysis of Transformer Based Models (BERT, ALBERT and RoBERTa) in Fake News Detection},
author = {Shafna Fitria Nur Azizah and Hasan Dwi Cahyono and Sari Widya Sihwi and Wisnu Widiarto},
journal= {arXiv preprint arXiv:2308.04950},
year = {2023}
}
备注
6 pages, 4 figures, 3 tables