中文

MASV:基于全局与局部上下文 Mamba 的说话人验证

音频与语音处理 2024-12-17 v1 声音

摘要

卷积神经网络和 Transformer 等深度学习模型在语音验证中展现出了令人瞩目的能力,引起了研究界的广泛关注。然而,基于 CNN 的方法难以有效地对长序列音频进行建模,导致验证性能欠佳。另一方面,基于 Transformer 的方法常常受到高计算需求的阻碍,限制了其实用性。本文提出了 MASV 模型,这是一种将 Mamba 模块集成到 ECAPA-TDNN 框架中的新架构。通过引入局部上下文双向 Mamba 和 Tri-Mamba 块,该模型有效地捕获了音频序列中的全局和局部上下文。实验结果表明,MASV 模型显著提升了验证性能,在准确性和效率上均超越了现有模型。

关键词

引用

@article{arxiv.2412.10989,
  title  = {MASV: Speaker Verification with Global and Local Context Mamba},
  author = {Yang Liu and Li Wan and Yiteng Huang and Ming Sun and Yangyang Shi and Florian Metze},
  journal= {arXiv preprint arXiv:2412.10989},
  year   = {2024}
}