LADLE-MM:基于有限标注与学习型集成器的多模态误情检测器
计算机视觉与模式识别
2025-12-24 v1
摘要
随着易于获取的工具用于生成和操作多媒体内容,数字媒体的逼真合成修改已成为广泛威胁,常涉及跨多个模态的同步操纵。最近,这些技术日益被用于扭曲重要事件叙事并在社交媒体上传播误情,促使开发误情检测器。在通过图像-文本对传递的误情语境中,已提出若干检测方法。然而,这些方法通常依赖计算密集型架构或需要大量标注数据。本文引入了 LADLE-MM:有限标注基于检测器与学习型集成器的多模态误情检测器,是一个在有限标注设置和受限训练资源下运行的模型汤初始化的多模态误情检测器。LADLE-MM 由两个单模态分支和一个第三模态分支组成,后者通过从 BLIP 中提取的额外多模态嵌入来增强图像和文本表示,作为固定参考空间。尽管使用比以前的国家级模型少 60.3% 的可训练参数,LADLE-MM 在 DGM4 数据集上的二分类和多标签分类任务上仍实现了具竞争力的性能,超过了在无 grounding 标注下训练的现有方法。此外,在 VERITE 数据集上评估时,LADLE-MM 超过了使用涉及大型视觉语言模型的更复杂架构的当前国家级方法,显示出在开放集合设置中的有效泛化能力和对单模态偏见的强鲁棒性。
引用
@article{arxiv.2512.20257,
title = {LADLE-MM: Limited Annotation based Detector with Learned Ensembles for Multimodal Misinformation},
author = {Daniele Cardullo and Simone Teglia and Irene Amerini},
journal= {arXiv preprint arXiv:2512.20257},
year = {2025}
}