基于 CTC 与多粒度子词单元的层次化条件端到端语音识别
音频与语音处理
2022-02-09 v2 计算与语言
摘要
在端到端自动语音识别(ASR)中,期望模型隐式地学习适于识别词级序列的表示。然而,输入声学信号与输出语言符号之间的巨大抽象鸿沟使模型难以学习这些表示。在本工作中,为促进端到端 ASR 中的词级表示学习,我们提出一种基于连接主义时序分类(CTC)的层次化条件模型。我们的模型通过作用于中间层的辅助 CTC 损失进行训练,其中每个目标子词序列的词表大小随着层接近词级输出而逐渐增大。此处,我们使每一层的序列预测显式地以低层预测出的前序序列为条件。借助所提方法,我们期望该模型能通过利用语言结构的层次性来有效学习词级表示。在 LibriSpeech-{100h, 960h} 和 TEDLIUM2 上的实验结果表明,所提模型优于标准的基于 CTC 的模型及先前工作中的其他竞争模型。我们进一步分析结果以确认模型预期表示学习的有效性。
引用
@article{arxiv.2110.04109,
title = {Hierarchical Conditional End-to-End ASR with CTC and Multi-Granular Subword Units},
author = {Yosuke Higuchi and Keita Karube and Tetsuji Ogawa and Tetsunori Kobayashi},
journal= {arXiv preprint arXiv:2110.04109},
year = {2022}
}
备注
Accepted to ICASSP2022