用于多语言声学模型的神经语言编码
计算与语言
2018-07-06 v1 机器学习
声音
音频与语音处理
摘要
多语言语音识别是最为昂贵的 AI 问题之一,因为每种语言(7000 多种)甚至不同口音都需要各自的声学模型以获得最佳识别性能。尽管它们都使用相同的音素符号,但每种语言和口音都赋予其自身的色彩或“腔调”。已提出许多自适应方法,但它们需要进一步的训练、额外的数据,且通常劣于单语训练的模型。在本文中,我们提出一种不同的方法,使用一个大型多语言模型,该模型由一个辅助网络生成的编码进行调制,该辅助网络学习对人类语言的“腔调”之间的有用差异进行编码。我们使用 Meta-Pi 网络使一个网络(语言编码网络)门控另一个网络(声学模型网络)中神经元的活动。我们的结果表明,在识别过程中,多语言 Meta-Pi 网络无需重新训练或新数据即可快速适应恰当的语言色彩,并且表现优于单语训练的 networks。该模型通过联合训练声学建模网络和调制语言编码网络并优化它们以获得最佳识别性能来进行评估。
引用
@article{arxiv.1807.01956,
title = {Neural Language Codes for Multilingual Acoustic Models},
author = {Markus Müller and Sebastian Stüker and Alex Waibel},
journal= {arXiv preprint arXiv:1807.01956},
year = {2018}
}
备注
5 pages, 3 figures, accepted at Interspeech 2018