AVT2-DWF:结合视听融合与动态加权策略改进 Deepfake 检测
计算机视觉与模式识别
2024-03-25 v1
摘要
随着 deepfake 方法的不断改进,伪造信息已从单模态过渡到多模态融合,对现有的伪造检测算法提出了新的挑战。在本文中,我们提出了 AVT2-DWF,一种基于动态权重融合的视听双 Transformer,旨在放大模态内和跨模态的伪造线索,从而增强检测能力。AVT2-DWF 采用双阶段方法来捕捉面部表情的空间特征和时间动态。这是通过采用具有 n 帧分词策略编码器的人脸 Transformer 和音频 Transformer 编码器来实现的。随后,它使用带有动态权重融合的多模态转换,以解决音频和视觉模态之间异构信息融合的挑战。在 DeepfakeTIMIT、FakeAVCeleb 和 DFDC 数据集上的实验表明,AVT2-DWF 在数据集内和跨数据集 Deepfake 检测中均取得了 SOTA 性能。代码可在 https://github.com/raining-dev/AVT2-DWF 获取。
引用
@article{arxiv.2403.14974,
title = {AVT2-DWF: Improving Deepfake Detection with Audio-Visual Fusion and Dynamic Weighting Strategies},
author = {Rui Wang and Dengpan Ye and Long Tang and Yunming Zhang and Jiacheng Deng},
journal= {arXiv preprint arXiv:2403.14974},
year = {2024}
}