听不见的谎言:基于多频率通道注意力机制的音频深度伪造检测
声音
2024-12-13 v1 计算与语言
音频与语音处理
摘要
随着人工智能技术的快速发展,深度伪造技术在音频领域的应用日益增多,导致安全风险范围不断扩大。尤其是在金融和社会安全领域,深度伪造音频的滥用引发了严重关切。为应对这一挑战,本文提出一种基于多频率通道注意力机制(MFCA)和二维离散余弦变换(2D DCT)的音频深度伪造检测方法。通过将音频信号处理为梅尔频谱图(melspectrogram),使用 MobileNet V2 提取深层特征,并结合 MFCA 模块对音频信号中不同频率通道进行加权,此方法能够有效捕捉音频信号中细粒度的频域特征,增强对伪造音频的分类能力。实验结果表明,与传统方法相比,本文提出的方法在准确率、精确率、召回率、F1 分值等指标上均显示出显著优势。尤其在复杂音频场景下,该方法展现出更强的鲁棒性和泛化能力,为音频深度伪造检测提供了新的思路,并具有重要的实际应用价值。未来将探索更多先进的音频检测技术和优化策略,以进一步提升音频深度伪造检测的准确率和泛化能力。
引用
@article{arxiv.2412.09467,
title = {Audios Don't Lie: Multi-Frequency Channel Attention Mechanism for Audio Deepfake Detection},
author = {Yangguang Feng},
journal= {arXiv preprint arXiv:2412.09467},
year = {2024}
}