中文

基于一致性与不变性泛化学习的短视频误导信息检测

计算机视觉与模式识别 2025-09-01 v3 多媒体

摘要

短视频误导信息检测在多模态领域引起了广泛关注,旨在准确识别伴随相应音频的视频格式误导信息。尽管取得了显著进展,当前模型在特定领域(源域)训练后,常在未见领域(目标域)表现不佳,因领域差异。为实现短视频误导信息检测的有效域外泛化,本文对不同领域特征提出深入见解:(1)不同领域的检测可能主要依赖不同模态(即主要关注视频或音频),要实现域泛化,关键在于同时优化所有模态的模型性能。(2)部分领域聚焦跨模态联合欺诈,需依赖跨模态融合进行全面分析。然而,每个模态(尤其是视频的每个帧)中的域偏差会在融合过程中累积,可能严重损害误导信息的最终识别。为解决这些问题,我们提出了新的域外泛化模型,通过一致性与不变性学习实现短视频误导信息检测(命名为DOCTOR),包含两个特色模块:(1)我们引入跨模态特征插值,将多个模态映射到共享空间,并通过插值蒸馏同步多模态学习;(2)我们设计扩散模型对多模态特征添加噪声,以保留核心特征并通过跨模态引导去噪来增强领域不变特征。大量实验表明,我们提出的DOCTOR模型有效。我们的代码已公开于https://github.com/ghh1125/DOCTOR。

关键词

引用

@article{arxiv.2507.04061,
  title  = {Consistent and Invariant Generalization Learning for Short-video Misinformation Detection},
  author = {Hanghui Guo and Weijie Shi and Mengze Li and Juncheng Li and Hao Chen and Yue Cui and Jiajie Xu and Jia Zhu and Jiawei Shen and Zhangze Chen and Sirui Han},
  journal= {arXiv preprint arXiv:2507.04061},
  year   = {2025}
}

备注

Accepted to ACM MM 2025