中文

MM-FusionNet:基于大型视觉语言模型的多模态假新闻检测中的上下文感知动态融合

密码学与安全 2025-08-11 v1 机器学习

摘要

社交媒体上多模态假新闻的不断涌现对公众信任和社会稳定构成了重大威胁。传统检测方法主要基于文本,往往难以应对误导性文本与图像之间的误导性相互作用。虽然大型视觉语言模型(Large Vision-Language Models, LVLMs)为多模态理解提供了前景,但有效融合不同模态信息——尤其是在模态重要性不平衡或相互矛盾时——仍是一个关键挑战。本文引入 MM-FusionNet,一个创新性框架,利用 LVLMs 实现稳健的多模态假新闻检测。我们的核心贡献是上下文感知动态融合模块(Context-Aware Dynamic Fusion Module, CADFM),它采用双向跨模态注意力和新颖的动态模态门控网络。该机制基于上下文相关性自适应学习并为文本和视觉特征分配重要性权重,从而实现信息的智能优先级排序。在由 80,000 样本组成的大型多模态假新闻数据集(Multi-modal Fake News Dataset, LMFND)上评估的 MM-FusionNet 以 SOTA 的 F1 分数 0.938 成果,超越现有多模态基线约 0.5%,显著优于单模态方法。进一步分析表明,该模型的动态加权能力、对模态扰动的鲁棒性以及性能接近人类水平,凸显了其在实际假新闻检测中的实用性和可解释性。

关键词

引用

@article{arxiv.2508.05684,
  title  = {MM-FusionNet: Context-Aware Dynamic Fusion for Multi-modal Fake News Detection with Large Vision-Language Models},
  author = {Junhao He and Tianyu Liu and Jingyuan Zhao and Benjamin Turner},
  journal= {arXiv preprint arXiv:2508.05684},
  year   = {2025}
}