中文

BiCrossMamba-ST:基于双向 Mamba 声学-时序交叉注意力的语音深度伪造检测

声音 2025-05-21 v1 音频与语音处理

摘要

我们提出了 BiCrossMamba-ST,一个用于语音深度伪造检测的稳健框架,利用双向 Mamba 块和相互交叉注意力构建的双支架声学-时序架构。通过分别处理频谱子带和时序区间的特征,再整合其表征,BiCrossMamba-ST 有效捕捉合成语音的细微线索。此外,本文提出的框架利用基于卷积的二维注意力图聚焦于特定的声学-时序区域,实现稳健的深度伪造检测。直接处理原始特征,BiCrossMamba-ST 在 ASVSpoof LA21 和 ASVSpoof DF21 数据集上相较于最先进的 AASIST 获得了 67.74% 和 26.3% 的相对提升,在 ASVSpoof DF21 数据集上相较于 RawBMamba 提升了 6.80%。代码和模型将公开释放。

关键词

引用

@article{arxiv.2505.13930,
  title  = {BiCrossMamba-ST: Speech Deepfake Detection with Bidirectional Mamba Spectro-Temporal Cross-Attention},
  author = {Yassine El Kheir and Tim Polzehl and Sebastian Möller},
  journal= {arXiv preprint arXiv:2505.13930},
  year   = {2025}
}

备注

Accepted Interspeech 2025