中文

MOMENTA: 基于多模态嵌入混合专家模型与时序聚合的虚假信息检测

多媒体 2026-04-20 v1

摘要

社交媒体上多模态内容的广泛传播使得虚假信息检测日益困难,因为误导性叙述往往不仅源于文本或视觉内容本身,还源于模态间的语义不一致及其随时间演变。现有的多模态虚假信息检测方法通常静态地建模跨模态交互,并且在异构数据集、领域和叙述设置中往往表现出有限的鲁棒性。为应对这些挑战,我们提出了MOMENTA,一个统一的多模态虚假信息检测框架,它在单一架构中捕获模态异质性、跨模态不一致性、时间动态和跨领域泛化。MOMENTA采用模态特定的混合专家模块来建模多样化的虚假信息模式,使用双向共注意力在共享语义空间中对齐文本和视觉表示,并利用一个差异感知分支显式捕获模态间的语义分歧。为了建模叙述演变,我们引入了一种基于注意力的时序聚合机制,该机制在重叠时间窗口上具有漂移和动量编码,使框架能够捕获虚假信息传播中的短期波动和长期趋势。此外,领域对抗学习和原型记忆库提高了领域不变性,并稳定了跨数据集的表示学习。该模型采用多目标优化策略进行训练,该策略共同强制执行分类性能、跨模态对齐、对比学习、时序一致性和领域鲁棒性。在Fakeddit、MMCoVaR、Weibo和XFacta上的实验表明,MOMENTA在准确率、F1分数、AUC和MCC指标上取得了强大且一致的结果,突显了其在多模态虚假信息检测中的有效性。

关键词

引用

@article{arxiv.2604.16172,
  title  = {MOMENTA: Mixture-of-Experts Over Multimodal Embeddings with Neural Temporal Aggregation for Misinformation Detection},
  author = {Yeganeh Abdollahinejad and Ahmad Mousavi and Naeemul Hassan and Kai Shu and Nathalie Japkowicz and Shahriar Khosravi and Amir Karami},
  journal= {arXiv preprint arXiv:2604.16172},
  year   = {2026}
}