中文

基于 WaveNet 的神经声码器的在线说话人自适应

音频与语音处理 2020-08-17 v1

摘要

本文提出一种用于基于 WaveNet 的神经声码器的在线说话人自适应方法,以提升其在说话人无关波形生成上的性能。该方法中,首先使用一个大规模说话人验证数据集构建说话人编码器,该编码器可从任意说话人发出的 utterance 中提取说话人嵌入向量。在训练阶段,随后使用多说话人数据集构建说话人感知的 WaveNet 声码器,其将声学特征序列与说话人嵌入向量同时作为条件。在生成阶段,我们首先将来自测试说话人的声学特征序列输入说话人编码器,以获取该 utterance 的说话人嵌入向量。然后,说话人嵌入向量与声学特征一同通过说话人感知的 WaveNet 声码器来重建语音波形。实验结果表明,相较于传统的说话人无关 WaveNet 声码器,我们的方法在重建未见说话人波形上能取得更好的客观与主观性能。

关键词

引用

@article{arxiv.2008.06182,
  title  = {Online Speaker Adaptation for WaveNet-based Neural Vocoders},
  author = {Qiuchen Huang and Yang Ai and Zhenhua Ling},
  journal= {arXiv preprint arXiv:2008.06182},
  year   = {2020}
}

备注

6 pages, 2 figures, 4 tables