面向音视频深度伪造检测与定位的情境跨模态注意力机制
声音
2024-08-08 v2 人工智能
计算机视觉与模式识别
多媒体
音频与语音处理
摘要
在数字时代,基于多模态操纵(如音视频)的深度伪造和合成媒体对社会和政治完整性构成严重威胁。基于注意力机制融合来自多个模态的异构数据流的当前多模态深度伪造检测器常常面临分布性模态差距的挑战,这在有效融合和因此多模态深度伪造检测中具有挑战性。本文提出了一种基于循环神经网络(RNN)的新型多模态注意力框架,利用情境信息进行音视频深度伪造检测。该方法对多模态多序列表示应用注意力机制,学习其中对深度伪造检测和定位的贡献特征。在音视频深度伪造数据集(即FakeAVCeleb、AV-Deepfake1M、TVIL和LAV-DF)上进行详尽的实验验证,证明了该方法的有效性。与已发表研究进行交叉比较,显示出在深度伪造检测和定位方面分别提高了3.47%和2.05%的优异性能。为保证可重复性,代码和数据集信息均可在https://github.com/vcbsl/audiovisual-deepfake/获取。
引用
@article{arxiv.2408.01532,
title = {Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization},
author = {Vinaya Sree Katamneni and Ajita Rattani},
journal= {arXiv preprint arXiv:2408.01532},
year = {2024}
}