中文

XLSR-MamBo:面向音频深度伪造检测的扩展Mamba-注意力混合主干网络

音频与语音处理 2026-04-20 v3

摘要

先进的语音合成技术已实现高度逼真的语音生成,构成安全风险,推动了音频深度伪造检测(ADD)的研究。虽然状态空间模型(SSM)具有线性复杂度,但纯因果SSM架构常难以捕获内容检索,以识别全局频域瑕疵。在此基础上,我们探索混合架构的扩展性,提出XLSR-MamBo,一个模块化框架,将XLSR前端与协同Mamba-注意力后端集成。我们系统评估了四种拓扑结构,采用先进的SSM变体:Mamba、Mamba2、Hydra和Gated DeltaNet。实验结果表明,MamBo-3-Hydra-N3配置在ASVspoof 2021 LA、DF和In-the-Wild基准上,达到与其他最先进系统相当的性能。这一性能得益于Hydra的原生双向建模,更高效地捕获整体时序依赖,优于先前方法中启发式双支架策略。此外,针对DFADD数据集的评估显示,其对未见的扩散和流匹配合成方法具有稳健的泛化能力。关键的是,我们的分析揭示,扩大主干网络深度可有效缓解浅层模型所观察到的性能波动和不稳定性。这些结果表明,混合框架能够捕获伪造语音信号中的瑕疵,为ADD提供了有效方法。

关键词

引用

@article{arxiv.2601.02944,
  title  = {XLSR-MamBo: Scaling the Hybrid Mamba-Attention Backbone for Audio Deepfake Detection},
  author = {Kwok-Ho Ng and Tingting Song and Yongdong Wu and Zhihua Xia},
  journal= {arXiv preprint arXiv:2601.02944},
  year   = {2026}
}

备注

11 pages, 3 figures, Accepted by ACL 2026 Findings