MASV:基于全局与局部上下文 Mamba 的说话人验证
音频与语音处理
2024-12-17 v1 声音
摘要
卷积神经网络和 Transformer 等深度学习模型在语音验证中展现出了令人瞩目的能力,引起了研究界的广泛关注。然而,基于 CNN 的方法难以有效地对长序列音频进行建模,导致验证性能欠佳。另一方面,基于 Transformer 的方法常常受到高计算需求的阻碍,限制了其实用性。本文提出了 MASV 模型,这是一种将 Mamba 模块集成到 ECAPA-TDNN 框架中的新架构。通过引入局部上下文双向 Mamba 和 Tri-Mamba 块,该模型有效地捕获了音频序列中的全局和局部上下文。实验结果表明,MASV 模型显著提升了验证性能,在准确性和效率上均超越了现有模型。
关键词
引用
@article{arxiv.2412.10989,
title = {MASV: Speaker Verification with Global and Local Context Mamba},
author = {Yang Liu and Li Wan and Yiteng Huang and Ming Sun and Yangyang Shi and Florian Metze},
journal= {arXiv preprint arXiv:2412.10989},
year = {2024}
}