面向多语言声学建模的对抗训练
计算与语言
2019-06-18 v1 机器学习
声音
音频与语音处理
摘要
多语言训练已证明可通过共享和迁移不同语言建模中的知识来提升声学建模性能。知识共享通常通过在深度神经网络中为不同语言使用公共的底层来实现。近来,领域对抗网络被提出用于减小训练数据的领域失配并学习领域不变特征。因此值得探索对抗训练是否能进一步促进多语言模型中的知识共享。本工作中,我们应用领域对抗网络来促使多语言模型的共享层学习语言不变特征。双向长短期记忆(LSTM)循环神经网络(RNN)被用作基本构件。我们表明以此方式学习的共享层包含更少的语言识别信息并带来更优性能。在涵盖七种语言的自动语音识别任务中,所得声学模型使多语言模型的平均词错误率(WER)相对降低 4%,使单语模型降低 10%。
引用
@article{arxiv.1906.07093,
title = {Adversarial Training for Multilingual Acoustic Modeling},
author = {Ke Hu and Hasim Sak and Hank Liao},
journal= {arXiv preprint arXiv:1906.07093},
year = {2019}
}