基于 Straight Through Gumbel Softmax 的双模态神经网络架构搜索用于音视频深度伪造检测
声音
2024-06-21 v1 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
深度伪造是生物识别身份验证的主要安全风险。该技术创建能够冒充真实人员的逼真假视频,能混淆依赖面部特征和语音模式进行识别的系统。现有的多模态深度伪造检测器依赖常规融合方法(如多数裁决和集成投票),这些方法往往难以适应变化的数据特征和复杂模式。本文引入 Straight-through Gumbel-Softmax (STGS) 框架,提供一种综合方法来搜索多模态融合模型架构。该框架采用两级搜索方法,对网络架构、参数和性能进行优化。最初,从背部网络中高效地识别关键特征,而在细胞结构内部,采用加权融合操作整合来自各种来源的信息。通过变化参数(如温度和采样时间),可推导出最大化分类性能的网络架构。在 FakeAVCeleb 和 SWAN-DF 数据集上的实验结果表明,采用最小模型参数即可实现 AUC 值达94.4%。
引用
@article{arxiv.2406.13384,
title = {Straight Through Gumbel Softmax Estimator based Bimodal Neural Architecture Search for Audio-Visual Deepfake Detection},
author = {Aravinda Reddy PN and Raghavendra Ramachandra and Krothapalli Sreenivasa Rao and Pabitra Mitra and Vinod Rathod},
journal= {arXiv preprint arXiv:2406.13384},
year = {2024}
}