DIN-CTS:基于对比训练策略的低复杂度 Depthwise-Inception 神经网络用于深度伪造语音检测
声音
2025-04-01 v2 密码学与安全
音频与语音处理
摘要
本文提出一种基于低复杂度 Depthwise-Inception 网络 (DIN) 结合对比训练策略 (CTS) 的深度神经网络方法,用于深度伪造语音检测 (DSD)。在该框架中,输入音频录音首先通过短时傅里叶变换 (STFT) 和线性滤波 (LF) 转换为频谱图,然后用于训练 DIN。训练完成后,DIN 处理真实语音以提取音频嵌入,用于构建表示真实语音的高斯分布。随后,通过计算测试语音与该分布之间的距离来进行深度伪造检测,以确定该语音是伪造还是真实。为评估所提出的系统,我们在 ASVspoof 2019 LA 挑战赛的基准数据集上进行了大量实验。实验结果表明,Depthwise-Inception 网络与对比学习策略的结合在区分伪造和真实语音方面效果显著。我们采用单个低复杂度 DIN,仅使用 177 万参数和 9.85 亿次浮点运算次数 (FLOPS) 即可在 4 秒的短音频段上取得 Equal Error Rate (EER)、准确率 (Acc.)、F1 和 AUC 分别为 4.6%、95.4%、97.3% 和 98.9%。此外,我们的系统在 ASVspoof 2019 LA 挑战赛中超越了单一系统提交,展示了其在实际应用中的潜力。
引用
@article{arxiv.2502.20225,
title = {DIN-CTS: Low-Complexity Depthwise-Inception Neural Network with Contrastive Training Strategy for Deepfake Speech Detection},
author = {Lam Pham and Dat Tran and Phat Lam and Florian Skopik and Alexander Schindler and Silvia Poletti and David Fischinger and Martin Boyer},
journal= {arXiv preprint arXiv:2502.20225},
year = {2025}
}