用于单调注意力模型的 CTC 同步训练
计算与语言
2020-08-07 v3 机器学习
摘要
单调分块注意力(MoChA)已基于序列到序列框架被研究用于在线流式自动语音识别(ASR)。与连接主义时序分类(CTC)不同,由于解码器中的从左至右依赖关系,在训练的对齐边缘化过程中无法利用后向概率。这导致对齐误差传播至后续的词元生成。为解决该问题,我们提出 CTC 同步训练(CTC-ST),其中 MoChA 利用 CTC 对齐来学习最优单调对齐。参考 CTC 对齐从与解码器共享同一编码器的 CTC 分支提取。整个模型被联合优化,以使来自 MoChA 的期望边界与对齐保持同步。对 TEDLIUM release-2 与 Librispeech 语料的实验评估表明,所提方法显著改善识别效果,尤其对长语音段。我们还表明 CTC-ST 能够发挥 SpecAugment 对于 MoChA 的全部潜力。
引用
@article{arxiv.2005.04712,
title = {CTC-synchronous Training for Monotonic Attention Model},
author = {Hirofumi Inaguma and Masato Mimura and Tatsuya Kawahara},
journal= {arXiv preprint arXiv:2005.04712},
year = {2020}
}
备注
Accepted to Interspeech 2020