基于 CTC 的语音识别中的分层多任务学习
计算与语言
2019-03-08 v2
摘要
先前的工作表明,神经编码器-解码器语音识别可通过分层多任务学习得到改进,其中在深度编码器的中间层添加辅助任务。我们在基于连接主义时序分类(CTC)的语音识别背景下探索分层多任务学习的效果,并研究该方法的若干方面。与先前工作一致,我们观察到在中间层使用辅助音素损失训练子词级 CTC 模型时,电话会话语音识别(具体为 Eval2000 测试集)性能得到提升。我们分析了若干实验变量(如插值常数和辅助损失函数位置)的影响、较低资源设置下的性能,以及预训练与多任务学习之间的关系。我们观察到在我们的较高数据实验中分层多任务方法优于标准多任务训练,而在低资源设置下标准多任务训练表现良好。最佳结果通过结合分层多任务学习和预训练获得,其在 Eval2000 测试集上绝对词错率降低了 3.4%。
引用
@article{arxiv.1807.06234,
title = {Hierarchical Multitask Learning for CTC-based Speech Recognition},
author = {Kalpesh Krishna and Shubham Toshniwal and Karen Livescu},
journal= {arXiv preprint arXiv:1807.06234},
year = {2019}
}
备注
Technical Report