基于 BERT 的 Twitter 谣言检测分类系统
机器学习
2021-09-08 v1
摘要
社交媒体在舆论形成中的作用对社会各领域都有深远影响。尽管社交媒体提供了表达新闻和观点的平台,但由于 Twitter 和 Facebook 等平台上的帖子数量庞大,很难控制帖子的质量。错误信息和谣言对社会有持久影响,因为它们往往影响人们的观点,并可能促使人们非理性行动。因此,检测并删除这些平台上的谣言非常重要。防止谣言传播的唯一途径是通过对社交媒体帖子进行自动检测和分类。本文我们关注 Twitter 社交媒体,因为从 Twitter 收集数据相对容易。以往大多数研究使用监督学习方法来对 Twitter 上的谣言进行分类。这些方法依赖特征提取从推文文本中获取内容和上下文特征,以区分谣言和非谣言。然而,考虑到推文的数量,手动提取特征非常耗时。我们提出了一种利用 BERT 句子嵌入来识别 Twitter 上谣言的新方法,以替代 usual 的特征提取技术。我们使用 BERT 句子嵌入根据推文的上下文含义将每条推文的句子表示为向量。我们使用各种监督学习技术将这些向量分类为谣言或非谣言。与先前方法相比,我们基于 BERT 的模型将准确率提高了约 10%。
引用
@article{arxiv.2109.02975,
title = {BERT based classification system for detecting rumours on Twitter},
author = {Rini Anggrainingsih and Ghulam Mubashar Hassan and Amitava Datta},
journal= {arXiv preprint arXiv:2109.02975},
year = {2021}
}
备注
Consists of 10 pages, 5 figures, and 8 tables, has been submitted to IEEE transactions on Computational and Social Systems (still underreview process)