是否反转梯度:语音识别中对抗学习与多任务学习的经验比较
机器学习
2019-02-15 v3 计算与语言
声音
音频与语音处理
机器学习
摘要
转写数据集通常包含每条数据实例的说话人身份。我们研究两种在训练时融入该信息的方法:多任务学习(Multi-Task Learning)与对抗学习(Adversarial Learning)。在多任务学习中,目标是说话人预测;若语音识别与说话人识别两项任务共享一组底层特征,我们期望联合训练能提升性能。相反,对抗学习是一种学习对说话人不变表征的手段。若所学不变性有助于泛化到新说话人,我们期望获得更好性能。尽管这两种方法在语音识别中看似自然,但它们互不兼容,因其对应于反向传播至模型的相反梯度。为更好理解这些方法在错误率方面的影响,我们在受控设定下比较两种策略。此外,我们以半监督的对抗学习方式利用额外的未转写数据来降低错误率。结果表明,在大数据集上训练的深度模型无需任何辅助损失即已习得对说话人不变的表征。当考虑对抗学习与多任务学习时,对声学模型的影响似乎微小。然而,以半监督方式训练的模型能够改善错误率。
引用
@article{arxiv.1812.03483,
title = {To Reverse the Gradient or Not: An Empirical Comparison of Adversarial and Multi-task Learning in Speech Recognition},
author = {Yossi Adi and Neil Zeghidour and Ronan Collobert and Nicolas Usunier and Vitaliy Liptchinsky and Gabriel Synnaeve},
journal= {arXiv preprint arXiv:1812.03483},
year = {2019}
}