DIVER: 基于动态迭代视觉证据推理的多模态假新闻检测
计算机视觉与模式识别
2026-01-13 v1 人工智能
摘要
多模态假新闻检测对于缓解对抗性误information至关重要。现有方法依赖静态融合或大语言模型 (LLMs),面临计算冗余和幻觉风险 due to 弱视觉基础。为此,我们提出 DIVER (Dynamic Iterative Visual Evidence Reasoning),一种基于渐进式、证据驱动的推理范式的框架。DIVER 首先通过语言分析建立强大的文本基线,利用 intra-modal consistency 筛选不可靠或幻觉的主张。仅当文本证据不足时,框架才引入视觉信息,其中 inter-modal alignment verification 会自适应地确定是否需要更深入的视觉检查。对于存在显著跨模态语义不一致的样本,DIVER 有选择地调用细粒度视觉工具 (如 OCR 和密集描述生成) 以提取任务相关证据,该证据通过 基于不确定性的融合 进行迭代聚合,以细化多模态推理。在 Weibo、Weibo21 和 GossipCop 上的实验表明,DIVER 将优于最先进的基线平均提升 2.72\%,同时通过降低推理延迟 4.12 秒来优化推理效率。
引用
@article{arxiv.2601.07178,
title = {DIVER: Dynamic Iterative Visual Evidence Reasoning for Multimodal Fake News Detection},
author = {Weilin Zhou and Zonghao Ying and Chunlei Meng and Jiahui Liu and Hengyang Zhou and Quanchen Zou and Deyue Zhang and Dongdong Yang and Xiangzheng Zhang},
journal= {arXiv preprint arXiv:2601.07178},
year = {2026}
}
备注
13 pages