中文

RawBMamba:用于音频深度伪造检测的端到端双向状态空间模型

声音 2024-06-19 v2 音频与语音处理

摘要

用于区分真实音频与伪造音频的伪造痕迹可能存在于短程和长程段落中。因此,结合局部和全局特征信息可有效区分真实音频与伪造音频。本文提出一种端到端双向状态空间模型,命名为RawBMamba,用于捕获音频深度伪造检测中短程和长程判别性信息。具体而言,我们使用sinc层和多个卷积层捕获短程特征,然后设计双向Mamba以解决Mamba的单向建模问题,并进一步捕获长程特征信息。此外,我们开发了一个双向融合模块来整合嵌入向量,增强音频上下文表征,结合短程和长程信息。结果表明,我们提出的RawBMamba在ASVspoof2021 LA数据集上相较于Rawformer提升了34.1%,并在其他数据集上表现出竞争性能。

关键词

引用

@article{arxiv.2406.06086,
  title  = {RawBMamba: End-to-End Bidirectional State Space Model for Audio Deepfake Detection},
  author = {Yujie Chen and Jiangyan Yi and Jun Xue and Chenglong Wang and Xiaohui Zhang and Shunbo Dong and Siding Zeng and Jianhua Tao and Lv Zhao and Cunhang Fan},
  journal= {arXiv preprint arXiv:2406.06086},
  year   = {2024}
}

备注

Accepted by Interspeech 2024