中文

听不见的谎言:基于多频率通道注意力机制的音频深度伪造检测

声音 2024-12-13 v1 计算与语言 音频与语音处理

摘要

随着人工智能技术的快速发展,深度伪造技术在音频领域的应用日益增多,导致安全风险范围不断扩大。尤其是在金融和社会安全领域,深度伪造音频的滥用引发了严重关切。为应对这一挑战,本文提出一种基于多频率通道注意力机制(MFCA)和二维离散余弦变换(2D DCT)的音频深度伪造检测方法。通过将音频信号处理为梅尔频谱图(melspectrogram),使用 MobileNet V2 提取深层特征,并结合 MFCA 模块对音频信号中不同频率通道进行加权,此方法能够有效捕捉音频信号中细粒度的频域特征,增强对伪造音频的分类能力。实验结果表明,与传统方法相比,本文提出的方法在准确率、精确率、召回率、F1 分值等指标上均显示出显著优势。尤其在复杂音频场景下,该方法展现出更强的鲁棒性和泛化能力,为音频深度伪造检测提供了新的思路,并具有重要的实际应用价值。未来将探索更多先进的音频检测技术和优化策略,以进一步提升音频深度伪造检测的准确率和泛化能力。

关键词

引用

@article{arxiv.2412.09467,
  title  = {Audios Don't Lie: Multi-Frequency Channel Attention Mechanism for Audio Deepfake Detection},
  author = {Yangguang Feng},
  journal= {arXiv preprint arXiv:2412.09467},
  year   = {2024}
}