通过最小化互信息进行无监督风格与内容分离以用于语音合成
音频与语音处理
2020-03-16 v1 计算机视觉与模式识别
信息论
机器学习
声音
math.IT
摘要
我们提出一种由输入文本和以无监督方式从参考语音信号提取的风格向量生成语音的方法,即不需要风格标注(如说话人信息)。现有的无监督方法在训练期间通过从相应真值样本计算风格并使用解码器将风格向量与输入文本结合来生成语音。以这种方式训练模型会将内容信息泄漏到风格向量中。解码器可利用泄漏的内容并忽略部分输入文本以最小化重构损失。在推理时,当参考语音与输入内容不匹配时,输出可能不包含输入文本的全部内容。我们将此问题称为“内容泄漏”,并通过对抗训练公式显式估计并最小化风格与内容之间的互信息来解决。我们称我们的方法为 MIST——基于互信息的风格内容分离。该方法的主要目标是保留合成语音信号中的输入内容,我们通过词错误率(WER)衡量并展示相较最先进的无监督语音合成方法的显著改进。
引用
@article{arxiv.2003.06227,
title = {Unsupervised Style and Content Separation by Minimizing Mutual Information for Speech Synthesis},
author = {Ting-Yao Hu and Ashish Shrivastava and Oncel Tuzel and Chandra Dhir},
journal= {arXiv preprint arXiv:2003.06227},
year = {2020}
}
备注
Accepted at ICASSP 2020 (for presentation in a lecture session)