中文

Twitter-COMMs:检测气候、新冠与军事多模态虚假信息

计算机视觉与模式识别 2022-05-04 v2 计算与语言

摘要

检测脱离上下文的媒体(如 Twitter 上“误配说明文字”的图像)是一个相关问题,尤其在具有高度公共重要性的领域中。在这项工作中,我们旨在为气候变化、COVID-19 和军用车辆等话题开发抵御此类虚假信息的手段。我们首先提出一个大规模多模态数据集,包含超过 88.4 万条与这些话题相关的推文。接下来,我们提出一种基于 SOTA 的 CLIP 模型的检测方法,利用自动生成的困难图像-文本不匹配样本。虽然该方法在我们自动构建的脱离上下文推文上表现良好,但我们旨在验证其在代表真实世界的数据上的有效性。因此,我们在一组通过模仿现实世界中虚假信息而由人工生成的假样本上对其进行测试。相较于强基线,我们在高精确率区间取得了 11% 的检测提升。最后,我们分享了关于最佳模型设计的见解,并分析了这一新兴威胁所带来的挑战。

关键词

引用

@article{arxiv.2112.08594,
  title  = {Twitter-COMMs: Detecting Climate, COVID, and Military Multimodal Misinformation},
  author = {Giscard Biamby and Grace Luo and Trevor Darrell and Anna Rohrbach},
  journal= {arXiv preprint arXiv:2112.08594},
  year   = {2022}
}

备注

11 pages, 6 figures