中文

misinformation 网络导航:基于浏览器流量的虚假信息域名检测框架

社会与信息网络 2023-07-26 v1

摘要

虚假信息与宣传的泛滥是一项全球挑战,在 COVID-19 大流行和俄罗斯入侵乌克兰等重大危机期间影响深远。理解虚假信息的传播及其社会影响需要识别散布虚假信息的新闻来源。尽管已有机器学习(ML)技术被提出以应对该问题,但 ML 模型未能提供可产生有用结果的高效部署方案。在先前研究中,真实流量中部署的精度显著恶化,相较基准数据集所得结果下降多达十倍。我们的研究通过提出一种基于图的方法填补这一空白,以捕获导航模式并生成基于流量的特征,用于训练分类模型。这些导航与基于流量的特征所构建的分类器在真实流量评估中表现出卓越性能。此外,我们还提出基于图的过滤技术,以筛选将由本框架分类的模型。这些过滤技术提高了待分类模型的信噪比,大幅减少误报并降低模型部署的计算成本。我们提出的虚假信息域名检测框架在真实流量中评估达到 0.78 的精度,相较先前研究的结果提升超过十倍。

关键词

引用

@article{arxiv.2307.13180,
  title  = {Navigating the Web of Misinformation: A Framework for Misinformation Domain Detection Using Browser Traffic},
  author = {Mayana Pereira and Kevin Greene and Nilima Pisharody and Rahul Dodhia and Jacob N. Shapiro and Juan Lavista},
  journal= {arXiv preprint arXiv:2307.13180},
  year   = {2023}
}