中文

面向真实通信降级下音频深度伪造检测的多粒度自适应时频注意力框架

音频与语音处理 2025-08-05 v1

摘要

高度令人信服的合成语音的兴起对音频通信构成了日益增长的威胁。尽管现有的音频深度伪造检测(ADD)方法在干净条件下表现良好,但在真实通信环境中,如数据包丢失和语音编解码器压缩等降级下,其有效性显著下降。在这项工作中,我们提出了第一个用于此类降级下鲁棒ADD的统一框架,该框架旨在有效适应多种类型的时频(TF)表示。我们框架的核心是一种新颖的多粒度自适应注意力(MGAA)架构,它采用一组可定制的多尺度注意力头,以捕获跨不同TF粒度的全局和局部感受野。一种新颖的自适应融合机制随后根据TF区域的显著性调整并融合这些注意力分支,使模型能够根据降级的特征动态重新分配其焦点。这使得能够有效定位和放大微妙的伪造痕迹。大量实验表明,所提出的框架在各种真实通信降级场景中,包括六种语音编解码器和五种级别的数据包丢失,始终优于最先进的基线。此外,比较分析表明,MGAA增强的特征显著提高了真实和虚假音频类别之间的可分离性,并锐化了决策边界。这些结果突显了我们的框架在真实通信环境中的鲁棒性和实际部署潜力。

关键词

引用

@article{arxiv.2508.01467,
  title  = {Multi-Granularity Adaptive Time-Frequency Attention Framework for Audio Deepfake Detection under Real-World Communication Degradations},
  author = {Haohan Shi and Xiyu Shi and Safak Dogan and Tianjin Huang and Yunxiao Zhang},
  journal= {arXiv preprint arXiv:2508.01467},
  year   = {2025}
}