基于帧级潜在信息熵的通用音频深度伪造检测
声音
2025-04-16 v1 音频与语音处理
摘要
由于文本转语音 (TTS) 和语音转换 (VC) 技术的快速发展,音频深度伪造检测中的通用性——即模型对未见数据的有效性能——至关重要。从信息论角度出发,我们假设信息内容是内在差异:真实样本代表对现实世界的密集、信息丰富的采样,而伪造样本则通常来自低维、信息较少的表示。为实现此目标,我们引入了帧级潜在信息熵检测器 (frame-level latent information entropy detector, f-InfoED),该方法从潜在表示的帧级提取独特信息熵,以识别音频深度伪造。此外,我们提出了 AdaLAM,通过可训练的适配器扩展大型预训练音频模型以实现更好的特征提取。为促进全面评估,构建了音频深度伪造 forensics 2024 (ADFF 2024) 数据集,包含最新的 TTS 和 VC 方法。大量实验表明,我们的方法实现了最先进的性能,并展现出显著的泛化能力。进一步的分析研究确认了 AdaLAM 在提取判别性音频特征方面的有效性,以及 f-InfoED 在利用潜在熵信息以实现更广泛深度伪造检测方面的有效性。
引用
@article{arxiv.2504.10819,
title = {Generalized Audio Deepfake Detection Using Frame-level Latent Information Entropy},
author = {Botao Zhao and Zuheng Kang and Yayun He and Xiaoyang Qu and Junqing Peng and Jing Xiao and Jianzong Wang},
journal= {arXiv preprint arXiv:2504.10819},
year = {2025}
}
备注
Accpeted by IEEE International Conference on Multimedia & Expo 2025 (ICME 2025)