中文

评估基于 BERT 的预训练语言模型在虚假信息检测中的表现

计算与语言 2022-03-16 v1 机器学习

摘要

由于缺乏对所有在线发布信息的监管,控制在线信息的质量具有挑战性。鉴于网络媒体上发布的帖子数量庞大且传播迅速,人工核查几乎不可能。因此,需要自动化的谣言检测技术来限制虚假信息传播的负面影响。以往的研究主要集中在发现和提取文本数据的重要特征上。然而,特征提取耗时且并非高效过程。本研究提出基于 BERT 的预训练语言模型,将文本数据编码为向量,并利用神经网络模型对这些向量进行分类以检测虚假信息。此外,比较了具有不同可训练参数的不同语言模型(LM)的性能。所提出的技术在不同的短文本和长文本数据集上进行了测试。该技术的结果已在同一数据集上与最先进(SOTA)技术进行了比较。结果表明,所提出的技术优于最先进的技术。我们还通过合并数据集来测试所提出的技术。结果表明,较大的训练与测试数据量显著提升了该技术的性能。

关键词

引用

@article{arxiv.2203.07731,
  title  = {Evaluating BERT-based Pre-training Language Models for Detecting Misinformation},
  author = {Rini Anggrainingsih and Ghulam Mubashar Hassan and Amitava Datta},
  journal= {arXiv preprint arXiv:2203.07731},
  year   = {2022}
}

备注

17 pages, 2 figures, 10 tables