MIS-AVoiDD:用于音视频深度伪造检测的模态不变与特定表示
计算机视觉与模式识别
2023-10-17 v2 人工智能
机器学习
摘要
Deepfakes(深度伪造)是利用深度生成算法合成的媒体,已对社会和政治造成严重威胁。除面部篡改与合成语音外,近来出现了一种新型深度伪造,其音频或视觉模态之一被篡改。为此,新一代多模态音视频深度伪造检测器正被研究,以共同关注音频与视觉数据进行多模态篡改检测。现有多模态(音视频)深度伪造检测器通常基于视频中音频流与视觉流的融合。已有研究表明,这些多模态检测器的性能往往与单模态音频和视觉深度伪造检测器相当。我们推测,音频与视觉信号的异构性造成了分布式的模态鸿沟,并对有效融合与高效性能构成重大挑战。本文在表示层面解决该问题,以辅助音频与视觉流的融合用于多模态深度伪造检测。具体而言,我们提出联合使用模态(音频与视觉)不变与特定表示。这确保了代表真实或伪造内容的各模态共有模式与特定模式被保留并融合,用于多模态深度伪造篡改检测。我们在 FakeAVCeleb 与 KoDF 音视频深度伪造数据集上的实验结果表明,相较 SOTA 单模态与多模态音视频深度伪造检测器,我们所提方法的准确率分别提升了 % 与 %。从而取得了最先进的性能。
引用
@article{arxiv.2310.02234,
title = {MIS-AVoiDD: Modality Invariant and Specific Representation for Audio-Visual Deepfake Detection},
author = {Vinaya Sree Katamneni and Ajita Rattani},
journal= {arXiv preprint arXiv:2310.02234},
year = {2023}
}
备注
8 pages, 3 figures