基于状态空间模型的高效低语音与多方言语音识别
音频与语音处理
2025-06-30 v2 声音
摘要
低语音识别对于传统的自动语音识别系统构成重大挑战,尤其是当面临方言变化时。然而,利用一种高效的方法来解决这一问题,尤其是在数据范围有限且计算负担较小的情况下,具有重要意义。本文提出了一种解决方案,采用基于Mamba的状态空间模型,结合四个微调的自监督模型(Wav2Vec2、WavLM、HuBERT和Whisper),以应对低语音与方言多样性的双重挑战。据我们所知,这是目前在wTIMIT和CHAINS数据集上实现低语音识别最佳性能的报告。我们使用来自新加坡、美国和爱尔兰方言的低语音与正常语音数据进行训练。实验结果表明,所提出的基于Mamba的模型可作为一种高效模型,仅需少量低语音数据即可同时处理低语音与正常语音识别。
引用
@article{arxiv.2506.16969,
title = {State-Space Models in Efficient Whispered and Multi-dialect Speech Recognition},
author = {Aref Farhadipour and Homayoon Beigi and Volker Dellwo and Hadi Veisi},
journal= {arXiv preprint arXiv:2506.16969},
year = {2025}
}
备注
paper is in 4+1 pages