基于 WaveNet 的神经声码器的在线说话人自适应
音频与语音处理
2020-08-17 v1
摘要
本文提出一种用于基于 WaveNet 的神经声码器的在线说话人自适应方法,以提升其在说话人无关波形生成上的性能。该方法中,首先使用一个大规模说话人验证数据集构建说话人编码器,该编码器可从任意说话人发出的 utterance 中提取说话人嵌入向量。在训练阶段,随后使用多说话人数据集构建说话人感知的 WaveNet 声码器,其将声学特征序列与说话人嵌入向量同时作为条件。在生成阶段,我们首先将来自测试说话人的声学特征序列输入说话人编码器,以获取该 utterance 的说话人嵌入向量。然后,说话人嵌入向量与声学特征一同通过说话人感知的 WaveNet 声码器来重建语音波形。实验结果表明,相较于传统的说话人无关 WaveNet 声码器,我们的方法在重建未见说话人波形上能取得更好的客观与主观性能。
引用
@article{arxiv.2008.06182,
title = {Online Speaker Adaptation for WaveNet-based Neural Vocoders},
author = {Qiuchen Huang and Yang Ai and Zhenhua Ling},
journal= {arXiv preprint arXiv:2008.06182},
year = {2020}
}
备注
6 pages, 2 figures, 4 tables