基于 Gumbel-Rao Monte Carlo 的双模态神经网络架构搜索用于音视频深度伪造检测
密码学与安全
2024-10-10 v1 声音
音频与语音处理
摘要
深度伪造构成对生物识别身份验证系统的严重威胁,能够生成高度逼真的合成媒体。现有多模态深度伪造检测器往往难以适应多样化数据,仅依赖简单融合方法。为此,我们提出一种 Gumbel-Rao Monte Carlo 双模态神经网络架构搜索(GRMC-BMNAS)框架,采用 Gumbel-Rao Monte Carlo 采样优化多模态融合。该方法通过 Rao-Blackwellization 降低方差,稳定网络训练。框架采用两级搜索方法,优化网络架构、参数和性能。从主干网络中高效识别关键特征,在细胞结构内部署加权融合操作以整合来自各种来源的信息。通过调整温度和蒙特卡洛抽样次数,可获得最大化分类性能和更好泛化能力的网络架构。在 FakeAVCeleb 和 SWAN-DF 数据集上的实验结果表明,本方法以 95.4% 的 AUC 成绩取得出色成绩,同时模型参数极少。
引用
@article{arxiv.2410.06543,
title = {Gumbel Rao Monte Carlo based Bi-Modal Neural Architecture Search for Audio-Visual Deepfake Detection},
author = {Aravinda Reddy PN and Raghavendra Ramachandra and Krothapalli Sreenivasa Rao and Pabitra Mitra Vinod Rathod},
journal= {arXiv preprint arXiv:2410.06543},
year = {2024}
}