基于多解码器和知识蒸馏的流式与非流式自动语音识别联合优化
音频与语音处理
2024-09-12 v1 计算与语言
声音
摘要
端到端自动语音识别(ASR)可以以两种模式运行:流式和非流式,各有优缺点。流式ASR在接收语音帧时实时处理,而非流式ASR等待整个语音话语;因此,专业人员可能需要根据其应用在两种模式中操作。在这项工作中,我们提出了基于多解码器和知识蒸馏的流式与非流式ASR联合优化。主要研究:1)这些ASR模块的编码器集成,随后2)使用单独的解码器使切换模式灵活,并通过3)在两个模块化编码器和解码器之间引入保持相似性的知识蒸馏来提升性能。评估结果显示,在CSJ上,流式ASR的相对字符错误率降低(CERR)为2.6%-5.3%,非流式ASR的相对CERR为8.3%-9.7%,且均在单个模型内实现,相比多个独立模块。
引用
@article{arxiv.2405.13514,
title = {Joint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation},
author = {Muhammad Shakeel and Yui Sudo and Yifan Peng and Shinji Watanabe},
journal= {arXiv preprint arXiv:2405.13514},
year = {2024}
}
备注
Accepted to IEEE ICASSP 2024 workshop Hands-free Speech Communication and Microphone Arrays (HSCMA 2024)