基于 CLIP 引导学习的多模态假新闻检测
计算机视觉与模式识别
2022-05-31 v1
摘要
多模态假新闻检测在社会取证中引起了诸多研究兴趣。许多现有方法引入定制注意力机制来引导单模态特征的融合。然而,这些特征如何计算相似性以及其如何影响假新闻检测(FND)中的决策过程仍是开放问题。此外,预训练多模态特征学习模型在假新闻检测中的潜力尚未被充分挖掘。本文提出 FND-CLIP 框架,即一种基于对比语言-图像预训练(CLIP)的多模态假新闻检测网络。给定目标多模态新闻,我们使用基于 ResNet 的编码器、基于 BERT 的编码器以及两个成对 CLIP 编码器提取图像与文本的深层表示。多模态特征是由两模态标准化跨模态相似性加权的 CLIP 生成特征的拼接。提取的特征在送入最终分类器前进一步进行冗余处理。我们引入模态级注意力模块以自适应重加权并聚合特征。我们在典型假新闻数据集上进行了大量实验。结果表明所提框架在挖掘假新闻检测关键特征方面具有更好的能力。所提 FND-CLIP 取得了优于以往工作的性能,即在 Weibo、Politifact 和 Gossipcop 上总体准确率分别提升 0.7%、6.8% 和 1.3%。此外,我们验证了基于 CLIP 的学习能更好地灵活选择多模态特征。
引用
@article{arxiv.2205.14304,
title = {Multimodal Fake News Detection via CLIP-Guided Learning},
author = {Yangming Zhou and Qichao Ying and Zhenxing Qian and Sheng Li and Xinpeng Zhang},
journal= {arXiv preprint arXiv:2205.14304},
year = {2022}
}
备注
Submitted to CIKM 2022