中文

SAVе:基于视觉残留和音视频错位的自监督音视频深度伪造检测框架

计算机视觉与模式识别 2026-03-27 v1 人工智能 机器学习 多媒体 声音

摘要

多模态深度伪造可能存在细微的视觉残留和跨模态不一致性,这些特征对检测器而言尤其具有挑战性,尤其是当检测器主要在精心挑选的合成伪造物上进行训练时。此类合成依赖性可能引入数据集和生成器偏差,限制了其对未见操纵方式的可扩展性和鲁棒性。我们提出了 SAVe,一个完全基于真实视频的自监督音视频深度伪造检测框架。SAVe 在现场生成身份保持、区域感知的自混合伪造物,以模拟篡改残留,使模型能够在多个面部细粒度层级上学习互补视觉线索。为捕捉跨模态证据,SAVe 还通过音视频对齐组件建模唇语同步,该组件检测音视频伪造所特有的时序错位模式。在 FakeAVCeleb 和 AV-LipSync-TIMIT 上的实验表明,SAVe 在同一数据集内表现竞争力,同时在跨数据集泛化方面表现强劲,凸显了自监督学习作为多模态深度伪造检测可扩展范式的潜力。

关键词

引用

@article{arxiv.2603.25140,
  title  = {SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment},
  author = {Sahibzada Adil Shahzad and Ammarah Hashmi and Junichi Yamagishi and Yusuke Yasuda and Yu Tsao and Chia-Wen Lin and Yan-Tsung Peng and Hsin-Min Wang},
  journal= {arXiv preprint arXiv:2603.25140},
  year   = {2026}
}