中文

基于两遍解码与交叉自适应的端到端 Conformer 与混合 TDNN 语音识别系统融合

音频与语音处理 2023-06-26 v1 人工智能

摘要

混合系统与端到端 (E2E) 自动语音识别 (ASR) 系统之间基本的建模差异使它们具有很大的多样性和互补性。本文研究基于多遍重打分和交叉自适应的混合 TDNN 与 Conformer E2E ASR 系统融合方法。在多遍重打分中,使用最先进的混合 LF-MMI 训练的 CNN-TDNN 系统(具有速度扰动、SpecAugment 和贝叶斯学习隐单元贡献 (LHUC) 说话人自适应)生成初始 N-best 输出,然后由说话人自适应的 Conformer 系统使用双向交叉系统分数插值进行重打分。在交叉自适应中,混合 CNN-TDNN 系统自适应到 Conformer 系统的 1-best 输出,或反之。在 300 小时 Switchboard 语料上的实验表明,使用两种系统融合方法中任一种得到的融合系统均优于单独系统。使用多遍重打分得到的最佳融合系统在 NIST Hub5'00、Rt03 和 Rt02 评测数据上,相比独立 Conformer 系统取得了 statistically significant 的字错误率 (WER) 绝对降低 2.5% 至 3.9%(相对降低 22.5% 至 28.9%)。

关键词

引用

@article{arxiv.2206.11596,
  title  = {Two-pass Decoding and Cross-adaptation Based System Combination of End-to-end Conformer and Hybrid TDNN ASR Systems},
  author = {Mingyu Cui and Jiajun Deng and Shoukang Hu and Xurong Xie and Tianzi Wang and Shujie Hu and Mengzhe Geng and Boyang Xue and Xunying Liu and Helen Meng},
  journal= {arXiv preprint arXiv:2206.11596},
  year   = {2023}
}

备注

It' s accepted to ISCA 2022