中文

基于神经语言模型训练数据增强的弱监督早期谣言检测

计算与语言 2019-07-17 v1 机器学习

摘要

训练数据的稀缺与类别不平衡是当前谣言检测任务中的已知问题。我们提出了一种直接且通用的数据增强技术,其有益于依赖事件传播模式的早期谣言检测。核心思想是利用社交媒体上大量未标注事件数据集来增强有限的标注谣言源推文。本工作基于近期谣言研究揭示的谣言传播模式以及标注与未标注数据之间的语义相关性。我们采用最先进的神经语言模型(NLM)和大型以可信度为中心的 Twitter 语料库来学习谣言推文的上下文敏感表示。我们的实验基于三个公开可用谣言数据集的六场不同真实世界事件,以对该方法的有效性进行比较评估。结果表明,我们的方法能以合理质量将现有谣言数据集规模扩展近 200%,相应社交上下文(即对话线程)扩展 100%。使用最先进的基于深度学习的谣言检测模型的初步实验表明,增强数据能缓解由有限训练数据引起的过拟合与类别不平衡,并有助于训练复杂神经网络(NNs)。借助增强数据,谣言检测性能在 F-score 上可提升 12.1%。我们的实验还表明,增强训练数据有助于将谣言检测模型泛化至未见过的谣言。

关键词

引用

@article{arxiv.1907.07033,
  title  = {Neural Language Model Based Training Data Augmentation for Weakly Supervised Early Rumor Detection},
  author = {Sooji Han and Jie Gao and Fabio Ciravegna},
  journal= {arXiv preprint arXiv:1907.07033},
  year   = {2019}
}

备注

8 pages