中文

基于置信度的端到端语音识别模型集成

音频与语音处理 2023-08-21 v1 计算与语言 机器学习

摘要

端到端语音识别模型的数量逐年增长。这些模型常被适配到新领域或新语言,导致专家系统激增,它们在目标数据上取得了优异结果,而在其专业领域之外通常表现较差。我们探索通过基于置信度的集成来组合此类专家:即仅使用最自信模型的输出的模型集成。我们假设模型的_target 数据不可用,除了一小部分验证集。我们用两个应用证明了我们方法的有效性。首先,我们展示了一个由 5 个单语模型组成的基于置信度的集成优于通过专用语言识别模块进行模型选择的系统。其次,我们证明可以组合基础模型与适配模型,以在原始数据和目标数据上均取得强劲结果。我们在多个数据集和模型架构上验证了所有结果。

关键词

引用

@article{arxiv.2306.15824,
  title  = {Confidence-based Ensembles of End-to-End Speech Recognition Models},
  author = {Igor Gitman and Vitaly Lavrukhin and Aleksandr Laptev and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2306.15824},
  year   = {2023}
}

备注

To appear in Proc. INTERSPEECH 2023, August 20-24, 2023, Dublin, Ireland