面向稳健深度伪造检测的音视频跨注意力 X-AVDT
计算机视觉与模式识别
2026-03-11 v1 人工智能
机器学习
摘要
当代生成系统产出的高度逼真合成视频的激增显著增加了恶意用途的风险,挑战性大于人类和现有检测器。置于此背景之下,我们从生成器侧出发,注意到这些模型内部的跨注意力机制编码了细粒度的语音-运动对齐信息,为伪造检测提供了有用的对应线索。基于此洞见,我们提出X-AVDT,一个稳健且可泛化的深度伪造检测器,通过DDIM反演获取生成器内部的音视频信号,以暴露这些线索。X-AVDT提取两种互补信号:(i) 捕获反演引起的视频差异的合成项,(ii) 反映生成过程中模态对齐的音视频跨注意力特征。为实现可靠的跨生成器评估,我们进一步引入MMDF,一个新的多模态深度伪造数据集,涵盖多样化的操纵类型和快速演化的合成范式,包括GAN、扩散和flow-matching。广泛实验表明,X-AVDT在MMDF上实现领先性能,并在外部基准和不可见生成器上实现强大的泛化,准确率提升13.1%。我们的发现凸显了利用内部音视频一致性线索对深度伪造检测的重要性,以应对未来生成器的稳健性。
引用
@article{arxiv.2603.08483,
title = {X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection},
author = {Youngseo Kim and Kwan Yun and Seokhyeon Hong and Sihun Cha and Colette Suhjung Koo and Junyong Noh},
journal= {arXiv preprint arXiv:2603.08483},
year = {2026}
}