中文

M2R-Whisper:用于增强Whisper的多阶段和多尺度检索增强

声音 2025-03-13 v3 音频与语音处理

摘要

像OpenAI的Whisper这样的领先模型在多语言自动语音识别(ASR)中表现出强大的性能,但仍面临在准确识别多样化亚方言时面临挑战。本文提出M2R-whisper,一种新型的多阶段和多尺度检索增强方法,旨在提升低资源环境下的ASR性能。基于上下文学习(ICL)和检索增强技术的原理,我们的方法在预处理阶段采用句子级ICL以利用上下文信息,同时将token级k最近邻(kNN)检索集成为后处理步骤,以进一步细化最终输出分布。通过有效地结合句子级和token级检索策略,M2R-whisper能够有效缓解各种类型的识别错误。在以普通话和亚方言数据集(包括AISHELL-1和KeSpeech)上的实验表明,M2R-whisper在ASR准确率上实现了显著提升,所有工作均未进行任何参数更新。

关键词

引用

@article{arxiv.2409.11889,
  title  = {M2R-Whisper: Multi-stage and Multi-scale Retrieval Augmentation for Enhancing Whisper},
  author = {Jiaming Zhou and Shiwan Zhao and Jiabei He and Hui Wang and Wenjia Zeng and Yong Chen and Haoqin Sun and Aobo Kong and Yong Qin},
  journal= {arXiv preprint arXiv:2409.11889},
  year   = {2025}
}

备注

Accepted by ICASSP 2025, oral