BiCrossMamba-ST:基于双向 Mamba 声学-时序交叉注意力的语音深度伪造检测
声音
2025-05-21 v1 音频与语音处理
摘要
我们提出了 BiCrossMamba-ST,一个用于语音深度伪造检测的稳健框架,利用双向 Mamba 块和相互交叉注意力构建的双支架声学-时序架构。通过分别处理频谱子带和时序区间的特征,再整合其表征,BiCrossMamba-ST 有效捕捉合成语音的细微线索。此外,本文提出的框架利用基于卷积的二维注意力图聚焦于特定的声学-时序区域,实现稳健的深度伪造检测。直接处理原始特征,BiCrossMamba-ST 在 ASVSpoof LA21 和 ASVSpoof DF21 数据集上相较于最先进的 AASIST 获得了 67.74% 和 26.3% 的相对提升,在 ASVSpoof DF21 数据集上相较于 RawBMamba 提升了 6.80%。代码和模型将公开释放。
引用
@article{arxiv.2505.13930,
title = {BiCrossMamba-ST: Speech Deepfake Detection with Bidirectional Mamba Spectro-Temporal Cross-Attention},
author = {Yassine El Kheir and Tim Polzehl and Sebastian Möller},
journal= {arXiv preprint arXiv:2505.13930},
year = {2025}
}
备注
Accepted Interspeech 2025