中文

基于语音辅助多目标单元建模改进 Conformer-Transducer ASR 系统

音频与语音处理 2023-07-10 v2 声音

摘要

利用有效的目标建模单元在端到端自动语音识别(ASR)中非常重要且一直备受关注。本工作中,我们提出一种语音辅助多目标单元(PMU)建模方法,以渐进式表示学习的方式增强 Conformer-Transducer ASR 系统。具体而言,PMU 首先利用发音辅助子词建模(PASM)与字节对编码(BPE)分别生成语音诱导与文本诱导的目标单元;随后,研究了三种新框架以增强声学编码器,包括基础 PMU、paraCTC 与 pcaCTC,它们在 CTC 与 transducer 多任务训练中于不同层级整合 PASM 与 BPE 单元。在 LibriSpeech 与口音 ASR 任务上的实验表明,所提 PMU 显著优于常规 BPE,其将 LibriSpeech clean、other 及六个口音 ASR 测试集的 WER 分别相对降低了 12.7%、6.0% 与 7.7%。

关键词

引用

@article{arxiv.2211.01571,
  title  = {Phonetic-assisted Multi-Target Units Modeling for Improving Conformer-Transducer ASR system},
  author = {Li Li and Dongxing Xu and Haoran Wei and Yanhua Long},
  journal= {arXiv preprint arXiv:2211.01571},
  year   = {2023}
}

备注

Accepted by Interspeech 2023