中文

像素与文字之间的桥接:掩码感知的局部语义融合用于多模态媒体验证

计算机视觉与模式识别 2026-03-30 v1 人工智能

摘要

随着多模态虚假信息的日益复杂,其检测与定位至关重要。然而,当前的多模态验证方法依赖被动整体融合,难以处理复杂的虚假信息。由于“特征稀释”,全局对齐倾向于平均出细微的局部语义不一致,从而有效地掩盖了它们旨在发现的冲突。我们引入MaLSF(掩码感知的局部语义融合),一种新型框架,将范式转向主动、双向验证,模仿人类认知的交叉引用。MaLSF利用掩码-标签配对作为语义锚点桥接像素与文字。其核心机制具有两种创新:1)一个双向跨模态验证(BCV)模块充当质询者,使用平行查询流(文本作为查询和图像作为查询)来明确指出冲突;2)一个层次化语义聚合(HSA)模块智能地聚合这些多粒度冲突信号以进行任务特定的推理。此外,为提取细粒度掩码-标签配对,我们引入了多样化的掩码-标签配对提取解析器。MaLSF在DGM4和多模态虚假新闻检测任务上实现了最先进的性能。大量消融实验和可视化结果进一步验证了其有效性和可解释性。

关键词

引用

@article{arxiv.2603.26052,
  title  = {Bridging Pixels and Words: Mask-Aware Local Semantic Fusion for Multimodal Media Verification},
  author = {Zizhao Chen and Ping Wei and Ziyang Ren and Huan Li and Xiangru Yin},
  journal= {arXiv preprint arXiv:2603.26052},
  year   = {2026}
}

备注

Accepted by CVPR 2026