中文

基于状态空间模型的高效低语音与多方言语音识别

音频与语音处理 2025-06-30 v2 声音

摘要

低语音识别对于传统的自动语音识别系统构成重大挑战,尤其是当面临方言变化时。然而,利用一种高效的方法来解决这一问题,尤其是在数据范围有限且计算负担较小的情况下,具有重要意义。本文提出了一种解决方案,采用基于Mamba的状态空间模型,结合四个微调的自监督模型(Wav2Vec2、WavLM、HuBERT和Whisper),以应对低语音与方言多样性的双重挑战。据我们所知,这是目前在wTIMIT和CHAINS数据集上实现低语音识别最佳性能的报告。我们使用来自新加坡、美国和爱尔兰方言的低语音与正常语音数据进行训练。实验结果表明,所提出的基于Mamba的模型可作为一种高效模型,仅需少量低语音数据即可同时处理低语音与正常语音识别。

关键词

引用

@article{arxiv.2506.16969,
  title  = {State-Space Models in Efficient Whispered and Multi-dialect Speech Recognition},
  author = {Aref Farhadipour and Homayoon Beigi and Volker Dellwo and Hadi Veisi},
  journal= {arXiv preprint arXiv:2506.16969},
  year   = {2025}
}

备注

paper is in 4+1 pages