中文

使用编码器-解码器网络更新基于 NMF 的语音转换字典

机器学习 2016-10-14 v1 机器学习 声音

摘要

在本文中,我们提出了一种用于谱转换(SC)任务中高维数据非负矩阵分解(NMF)的字典更新方法。由于其在个性化语音合成和语音增强等领域的潜在应用,语音转换已被广泛研究。只要给定源-目标平行语音语料库,基于样本的 NMF(ENMF)便成为所有 SC 技术中一种有效且可能是最简单的选择。基于 ENMF 的 SC 系统通常需要大量基(样本)以确保转换语音的质量。然而,通过字典更新获得一个小而有效的字典是理想但困难的,特别是当使用诸如 STRAIGHT 频谱等高维特征时。因此,我们通过编码器-解码器重构提出了一种 NMF 的字典更新框架。将 NMF 视为编码器-解码器网络,使得在应用于 SC 时能够更有效且高效地利用整个平行语料库。我们的实验表明,与使用相同或更大规模字典的传统基于 ENMF 的系统相比,所提出的具有小字典的系统获得了显著的增益。

关键词

引用

@article{arxiv.1610.03988,
  title  = {Dictionary Update for NMF-based Voice Conversion Using an Encoder-Decoder Network},
  author = {Chin-Cheng Hsu and Hsin-Te Hwang and Yi-Chiao Wu and Yu Tsao and Hsin-Min Wang},
  journal= {arXiv preprint arXiv:1610.03988},
  year   = {2016}
}