基于语音辅助多目标单元建模改进 Conformer-Transducer ASR 系统
音频与语音处理
2023-07-10 v2 声音
摘要
利用有效的目标建模单元在端到端自动语音识别(ASR)中非常重要且一直备受关注。本工作中,我们提出一种语音辅助多目标单元(PMU)建模方法,以渐进式表示学习的方式增强 Conformer-Transducer ASR 系统。具体而言,PMU 首先利用发音辅助子词建模(PASM)与字节对编码(BPE)分别生成语音诱导与文本诱导的目标单元;随后,研究了三种新框架以增强声学编码器,包括基础 PMU、paraCTC 与 pcaCTC,它们在 CTC 与 transducer 多任务训练中于不同层级整合 PASM 与 BPE 单元。在 LibriSpeech 与口音 ASR 任务上的实验表明,所提 PMU 显著优于常规 BPE,其将 LibriSpeech clean、other 及六个口音 ASR 测试集的 WER 分别相对降低了 12.7%、6.0% 与 7.7%。
引用
@article{arxiv.2211.01571,
title = {Phonetic-assisted Multi-Target Units Modeling for Improving Conformer-Transducer ASR system},
author = {Li Li and Dongxing Xu and Haoran Wei and Yanhua Long},
journal= {arXiv preprint arXiv:2211.01571},
year = {2023}
}
备注
Accepted by Interspeech 2023