基于跨尺度注意力和一致性学习的轻量级分辨率感知音频深度伪造检测
音频与语音处理
2026-01-13 v1 声音
摘要
音频深度伪造检测正面临着日益增大的挑战,这源于语音合成和语音转换技术的快速进步,尤其是在信道失真、重播攻击和真实世界录音条件下。为此,本文提出了一种分辨率感知的音频深度伪造检测框架,通过跨尺度注意力和一致性学习显式建模和对齐多分辨率频谱表示。与传统单分辨率或隐式特征融合方法不同,本方法强制在互补时频尺度之间实现一致性。该框架在三个代表性基准上进行评估:ASVspoof 2019(LA 和 PA)、Fake-or-Real (FoR) 数据集以及 In-the-Wild 音频深度伪造数据集,采用说话人不相干协议。该方法在 ASVspoof LA 上实现近乎完美的性能(EER 0.16%),在 ASVspoof PA 上表现出强大的鲁棒性(EER 5.09%),在 FoR 重录音频上达到 EER 4.54%,在野外深度伪造音频上达到 AUC 0.98、EER 4.81%,显著优于在挑战条件下的单分辨率和非注意力基线方法。该模型保持轻量级高效,仅需 159k 参数,单次推理 less than 1~GFLOP,适用于实际部署。全面的消融研究确认了跨尺度注意力和一致性学习的关键贡献,而基于梯度的可解释性分析则揭示了模型在不同欺骗条件下学习到分辨率一致且语义上有意义的频谱线索。这些结果表明,显式的跨分辨率建模为下一代音频深度伪造检测系统提供了原则性、稳健且可扩展的基础。
引用
@article{arxiv.2601.06560,
title = {Lightweight Resolution-Aware Audio Deepfake Detection via Cross-Scale Attention and Consistency Learning},
author = {K. A. Shahriar},
journal= {arXiv preprint arXiv:2601.06560},
year = {2026}
}