结合单模态聚合的 Mamba 流式语音识别
音频与语音处理
2024-12-30 v2 计算与语言
声音
摘要
本文工作于流式自动语音识别(ASR)。Mamba 是一种近期提出的状态空间模型,在 various 任务中表现出匹配或超越 Transformer 的能力,同时具有线性复杂度优势。我们探讨了 Mamba 编码器用于流式 ASR 的效率,并提出了一种关联前瞻机制,用于利用可控的未来信息。此外,实现了一种流式单模态聚合(unimodal aggregation, UMA)方法,该方法自动检测 token 活动情况和流式触发 token 输出,同时聚合特征帧以获得更好的 token 表示学习。在 UMA 基础上,提出了一种早期终止(early termination, ET)方法,以进一步减少识别延迟。在两个普通话数据集上进行的实验表明,所提出的模型在识别准确率和延迟方面均表现出竞争力。
引用
@article{arxiv.2410.00070,
title = {Mamba for Streaming ASR Combined with Unimodal Aggregation},
author = {Ying Fang and Xiaofei Li},
journal= {arXiv preprint arXiv:2410.00070},
year = {2024}
}
备注
Accepted by ICASSP 2025