中文

当 CTC 训练遇上声学地标

音频与语音处理 2019-02-28 v2 人工智能 声音

摘要

连接主义时序分类(CTC)提供了一种端到端声学模型(AM)训练策略。CTC 无需时间对齐的音素转写即可学习准确的 AM,但有时无法收敛,尤其在资源受限场景下。在本文中,通过引入声学地标改善了 CTC 的收敛特性。我们定制了一组新的声学地标,以帮助 CTC 训练更快速、平滑地收敛,同时降低识别错误率。我们利用混合了音素与方式变化的新目标标签序列来引导 CTC 训练。在 TIMIT 上的实验表明,当被声学地标增强时,基于 CTC 的声学模型收敛显著更快更平滑。用混合目标标签预训练的模型可进一步微调,在 TIMIT 上获得低于基线 8.72% 的音素错误率。在 WSJ(更大语料库)和缩减版 TIMIT(更小)上也观察到一致的性能提升。借助 WSJ,我们首次成功验证了声学地标理论在中等规模 ASR 任务上的有效性。

关键词

引用

@article{arxiv.1811.02063,
  title  = {When CTC Training Meets Acoustic Landmarks},
  author = {Di He and Xuesong Yang and Boon Pang Lim and Yi Liang and Mark Hasegawa-Johnson and Deming Chen},
  journal= {arXiv preprint arXiv:1811.02063},
  year   = {2019}
}

备注

To Appear in ICASSP 2019; The first two authors contributed equally