面向多语言ASR的选择性调用:适配语音识别难度的经济方案
声音
2025-05-23 v1 音频与语音处理
摘要
尽管多语言自动语音识别(ASR)系统取得显著进展,使单一模型可处理多种语言,但内在的语言差异与数据不平衡仍挑战其在所有语言上的SOTA性能。虽然语言识别(LID)模型可将语音路由至合适的ASR模型,但其高额昂费用(调用SOTA商业模型)以及因误分类导致的准确性不足成为主要障碍。为此,本文提出SIMA(Selective Invocation for Multilingual ASR),一种适配输入语音识别难度的选择性调用方案。基于口头大语言模型(SLLM),SIMA评估输入是否足够简单可直接转录,或需调用SOTA ASR模型。该方法较SLLM降低了18.7%的词错误率,较LID-based方法缩减了50%的调用成本。在三套数据集上测试表明,SIMA是一项可扩展且成本效益显著的多语言ASR解决方案。
引用
@article{arxiv.2505.16168,
title = {Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty},
author = {Hongfei Xue and Yufeng Tang and Jun Zhang and Xuelong Geng and Lei Xie},
journal= {arXiv preprint arXiv:2505.16168},
year = {2025}
}
备注
Accepted by INTERSPEECH 2025