中文

DiMoDif:面向音视频深度伪造检测与定位的数据模态信息差异化

计算机视觉与模式识别 2025-04-14 v2

摘要

深度伪造技术迅速发展,对在线多媒体信息的完整性和信任度构成严重威胁。尽管在深度伪造检测方面取得了显著进展,但同时在音频和视觉模态上进行人为操控,甚至以细微或局部方式呈现,仍构成极具挑战性的检测场景。为此,我们提出了 DiMoDif—a款基于机器感知中语音在不同模态间差异的音视频深度伪造检测框架。该方法基于“在真实样本中—与深度伪造不同——视觉信号与音频信号在信息上相吻合”的假设。DiMoDif 利用专注于视觉语音识别和音频语音识别的深度网络提取特征,以捕捉帧级别的跨模态不一致,从而实现深度伪造的时间局部化。为此,我们设计了层次化跨模态融合网络,集成自适应时间对齐模块和学习到的差异映射层,以显式建模视觉与音频表征之间的细微差异。随后,通过综合损失函数对检测模型进行优化,该损失函数同时考虑帧级别检测和假冒区间局部化。DiMoDif 在 AV-Deepfake1M 数据集上较当前最先进方法提升了 30.5 的 AUC,同时在 FakeAVCeleb 和 LAV-DF 数据集上表现卓越。在时间伪造局部化任务上,其在 AV-Deepfake1M 数据集上较当前最先进方法提升了 47.88 的 [email protected],在 LAV-DF 数据集上表现持平。代码已公开于 https://github.com/mever-team/dimodif。

关键词

引用

@article{arxiv.2411.10193,
  title  = {DiMoDif: Discourse Modality-information Differentiation for Audio-visual Deepfake Detection and Localization},
  author = {Christos Koutlis and Symeon Papadopoulos},
  journal= {arXiv preprint arXiv:2411.10193},
  year   = {2025}
}