基于直通估计器的语音链框架端到端反馈损失
计算与语言
2018-11-01 v1 机器学习
声音
音频与语音处理
摘要
语音链机制在训练中将自动语音识别(ASR)与文本到语音合成(TTS)模块整合为一个单一循环。在我们之前的工作中,我们将语音链机制用作半监督学习。它使ASR和TTS在接收到未配对数据时能够相互辅助,并让它们推断缺失的配对,以重构损失优化模型。如果我们仅有语音而无转写文本,ASR从语音数据生成最可能的转写,随后TTS利用生成的转写重构原始语音特征。然而,在以往的论文中,我们仅将反向传播限制于最近的模块,即TTS部分。原因之一是通过ASR反向传播误差具有挑战性,因为ASR的输出是离散词元,在TTS与ASR之间造成不可微性。本文中,我们解决该问题并描述如何使用直通估计器(ST)彻底地端到端训练语音链以用于重构损失。实验结果表明,通过ST-Gumbel-Softmax采样,我们能够更新ASR参数,并使ASR性能相比基线相对降低CER达11%。
引用
@article{arxiv.1810.13107,
title = {End-to-End Feedback Loss in Speech Chain Framework via Straight-Through Estimator},
author = {Andros Tjandra and Sakriani Sakti and Satoshi Nakamura},
journal= {arXiv preprint arXiv:1810.13107},
year = {2018}
}