范式转变:面向多模态假新闻检测的大型视觉语言模型综合综述
人工智能
2026-01-23 v1 计算机视觉与模式识别
摘要
近年来,大型视觉语言模型(LVLM)的快速发展推动了多模态假新闻检测(MFND)的范式转变,使其从传统的特征工程方法转变为统一的端到端多模态推理框架。早期方法主要依赖浅层融合技术来捕捉文本与图像之间的相关性,但它们在处理高级语义理解和复杂的跨模态交互方面存在困难。LVLM 的出现从根本上改变了这一局面,通过强大的表征学习实现了视觉与语言的联合建模,从而增强了检测那些同时利用文本叙述和视觉内容的错误信息的能力。尽管取得了这些进展,该领域仍缺乏一项系统性的综述来追踪这一转变并整合最新发展。为了填补这一空白,本文通过 LVLM 的视角对 MFND 进行了全面回顾。我们首先提供了一个历史视角,描绘了从传统多模态检测流程到基础模型驱动范式的演变。接着,我们建立了一个涵盖模型架构、数据集和性能基准的结构化分类体系。此外,我们分析了剩余的技术挑战,包括可解释性、时间推理和领域泛化。最后,我们概述了未来的研究方向,以指导这一范式转变的下一阶段。据我们所知,这是第一篇系统记录并分析 LVLM 在打击多模态假新闻中变革性作用的综合综述。所提及的现有方法总结见我们的 Github:\href{https://github.com/Tan-YiLong/Overview-of-Fake-News-Detection}{https://github.com/Tan-YiLong/Overview-of-Fake-News-Detection}。
引用
@article{arxiv.2601.15316,
title = {The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection},
author = {Wei Ai and Yilong Tan and Yuntao Shou and Tao Meng and Haowen Chen and Zhixiong He and Keqin Li},
journal= {arXiv preprint arXiv:2601.15316},
year = {2026}
}