中文

以词片与Conformer推进基于CTC-CRF的端到端语音识别

音频与语音处理 2021-07-09 v2 计算与语言 声音

摘要

自动语音识别系统在过去几十年中已取得大幅改进,当前系统主要基于混合方法与端到端方法。近期提出的 CTC-CRF 框架继承了混合方法的数据高效性与端到端方法的简洁性。在本文中,我们通过建模单元与神经架构上的探索进一步推进基于 CTC-CRF 的 ASR 技术。具体而言,我们研究了使近期发展的词片(wordpiece)建模单元与 Conformer 神经网络能够成功应用于 CTC-CRF 中的技术。实验在两个英语数据集(Switchboard、Librispeech)与来自 CommonVoice 的一个德语数据集上进行。实验结果表明:(i) Conformer 可显著改善识别性能;(ii) 对于形音对应程度低的目标语言(如英语),基于词片的系统表现略逊于基于音素的系统,而当目标语言的此类对应程度高时(如德语),两系统可表现同样强劲。

关键词

引用

@article{arxiv.2107.03007,
  title  = {Advancing CTC-CRF Based End-to-End Speech Recognition with Wordpieces and Conformers},
  author = {Huahuan Zheng and Wenjie Peng and Zhijian Ou and Jinsong Zhang},
  journal= {arXiv preprint arXiv:2107.03007},
  year   = {2021}
}

备注

Submitted to ASRU 2021