中文

接纳领域差异的假新闻:基于多模态数据的跨领域假新闻检测

计算与语言 2021-02-25 v4 信息检索 机器学习

摘要

随着社交媒体的快速发展,假新闻已成为一个重大的社会问题,依靠人工核查无法及时应对。这促使了大量关于自动化假新闻检测的研究。多数研究探索利用新闻记录的不同模态(如文本、图像和传播网络)进行有监督训练模型以识别假新闻。然而,若新闻记录来自不同领域(如政治、娱乐),尤其来自训练期间未见过或极少见的领域,此类技术的性能通常会下降。作为动机,我们通过实证表明,不同领域的新闻记录在用词和传播模式上存在显著差异。此外,由于未标记新闻记录数量庞大,难以挑选新闻记录进行人工标注以最大化标注数据集的领域覆盖度。因此,本工作:(1)提出一种新颖框架,联合保留新闻记录中领域特定与跨领域知识,以检测来自不同领域的假新闻;以及(2)引入一种无监督技术,挑选一组未标记且信息量大的新闻记录用于人工标注,最终可用于训练一个在多领域表现良好且最小化标注成本的假新闻检测模型。我们的实验表明,所提假新闻模型与选择性标注方法的结合在跨领域新闻数据集上取得了最先进(SOTA)性能,同时对新闻数据集中极少出现的领域带来显著提升。

关键词

引用

@article{arxiv.2102.06314,
  title  = {Embracing Domain Differences in Fake News: Cross-domain Fake News Detection using Multi-modal Data},
  author = {Amila Silva and Ling Luo and Shanika Karunasekera and Christopher Leckie},
  journal= {arXiv preprint arXiv:2102.06314},
  year   = {2021}
}