利用策略学习改进端到端语音识别
计算与语言
2017-12-20 v1 声音
音频与语音处理
机器学习
摘要
连接主义时序分类(CTC)被广泛用于端到端语音识别模型中的最大似然学习。然而,负最大似然与语音识别中所用性能度量(如词错误率(WER))之间通常存在差距。这导致训练时目标函数与度量不匹配。我们表明上述问题可通过最大似然与策略梯度的联合训练来缓解。特别地,借助策略学习,我们得以直接优化(否则不可微的)性能度量。我们表明,与通过最大似然学习的相同模型相比,联合训练使我们的端到端模型相对性能提升4%至13%。该模型在Wall Street Journal数据集上取得5.53%的WER,在Librispeech的test-clean和test-other集上分别取得5.42%和14.70%。
引用
@article{arxiv.1712.07101,
title = {Improving End-to-End Speech Recognition with Policy Learning},
author = {Yingbo Zhou and Caiming Xiong and Richard Socher},
journal= {arXiv preprint arXiv:1712.07101},
year = {2017}
}