中文

基于图神经网络与过采样在基准 Twitter 数据集上的谣言检测

计算与语言 2022-12-21 v1 机器学习

摘要

近年来,在线社交媒体已成为新信息和错误信息或谣言的主要来源。在缺乏自动谣言检测系统的情况下,谣言的传播成倍增加,导致严重的社会损害。在这项工作中,我们提出了一种构建自动谣言检测系统的新方法,重点通过过采样来缓解谣言检测任务中类别不平衡的根本挑战。我们的过采样方法依赖于上下文化数据增强,为数据集中代表性不足的类别生成合成样本。其关键思想是利用线程中推文的选择进行增强,这可以通过引入非随机选择标准来实现,以将增强过程聚焦于相关推文。此外,我们提出了两种图神经网络(GNN)来建模线程上的非线性对话。为了增强我们方法中的推文表示,我们采用了基于最先进的 BERTweet 模型的自定义特征选择技术。在三个公开可用数据集上的实验证实:1)我们的 GNN 模型比当前最先进的分类器高出 20% 以上(F1-score);2)我们的过采样技术将模型性能提高了 9% 以上(F1-score);3)通过非随机选择标准聚焦于相关推文进行数据增强可进一步改善结果;4)我们的方法在极早期阶段检测谣言具有优越能力。

关键词

引用

@article{arxiv.2212.10080,
  title  = {Rumour detection using graph neural network and oversampling in benchmark Twitter dataset},
  author = {Shaswat Patel and Prince Bansal and Preeti Kaur},
  journal= {arXiv preprint arXiv:2212.10080},
  year   = {2022}
}