基于Mamba的仅解码器方法结合双向语音建模用于语音识别
声音
2024-11-12 v1 音频与语音处理
摘要
由 Mamba 表示的选择性状态空间模型(SSM)已在各种任务中展示了其计算效率和有前景的结果,包括自动语音识别(ASR)。Mamba 已被应用于基于注意力编码器-解码器框架的 ASR 任务,其中编码器与解码器之间的交叉注意力机制仍然存在。本文探索了 Mamba 作为 ASR 任务中仅解码器架构的能力。我们的基于 Mamba 的仅解码器方法(MADEON)由单个解码器组成,该解码器以语音标记为条件,自回归地预测文本标记。为增强 MADEON,我们进一步提出了语音前缀处理,对语音标记进行双向处理,从而丰富隐藏状态中的上下文信息。我们的实验表明,MADEON 显著优于非选择性 SSM。语音前缀处理与最近提出的 Mamba-2 的结合在大规模数据集上取得了与基于 Transformer 的模型相当的性能。
引用
@article{arxiv.2411.06968,
title = {Mamba-based Decoder-Only Approach with Bidirectional Speech Modeling for Speech Recognition},
author = {Yoshiki Masuyama and Koichi Miyazaki and Masato Murata},
journal= {arXiv preprint arXiv:2411.06968},
year = {2024}
}
备注
Accepted to SLT 2024