中文

从网站截图识别错误信息

机器学习 2021-06-07 v2 人工智能 计算机与社会 社会与信息网络

摘要

网站的外观与质感能否提供关于一篇文章可信度的信息?本文中,我们提议使用一种在检测错误信息中被忽视却很有前景的方面:域名网页的整体外观。为捕捉该整体外观,我们对由传播错误信息或可信赖的网站域名所提供的新闻文章进行截图,并利用基于张量分解的半监督分类技术。所提出的方法即 VizFake 对若干图像变换不敏感,例如将图像转为灰度、向量化图像以及丢失截图的某些部分。VizFake 利用极少量的已知标签,反映了现实且实际的场景,其中标签(尤其是对已知错误信息文章)稀缺且迅速过时。VizFake 在涵盖超过 500 个域名的 5 万张新闻文章截图数据集上,仅使用 5% 的真实标签便取得了约 85% 的 F1 分数。此外,以无监督方式获得的 VizFake 张量表示允许对数据进行探索性分析,从而提供对问题的宝贵洞察。最后,我们将 VizFake 与深度迁移学习进行比较,因后者是一种非常流行的用于图像分类的黑盒方法,同时也与知名的基于文本的方法比较。VizFake 取得了与深度迁移学习模型相竞争的准确率,同时快两个数量级且不需要繁琐的超参数调优。

关键词

引用

@article{arxiv.2102.07849,
  title  = {Identifying Misinformation from Website Screenshots},
  author = {Sara Abdali and Rutuja Gurav and Siddharth Menon and Daniel Fonseca and Negin Entezari and Neil Shah and Evangelos E. Papalexakis},
  journal= {arXiv preprint arXiv:2102.07849},
  year   = {2021}
}