中文

我们距离鲁棒语音转换还有多远:一项综述

音频与语音处理 2021-05-04 v3 声音

摘要

近年来,在深度学习的助力下语音转换技术已取得巨大进步,但其在不同条件下生成自然语音的能力仍不明确。本文对已知 VC 模型的鲁棒性进行了深入研究。我们还修改了这些模型,例如替换说话人嵌入,以进一步提升其性能。我们发现采样率与音频时长对语音转换影响很大。所有 VC 模型均受未见过数据的影响,但 AdaIN-VC 相对更为鲁棒。此外,联合训练的说话人嵌入比在说话人识别上训练的嵌入更适用于语音转换。

关键词

引用

@article{arxiv.2011.12063,
  title  = {How Far Are We from Robust Voice Conversion: A Survey},
  author = {Tzu-hsien Huang and Jheng-hao Lin and Chien-yu Huang and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2011.12063},
  year   = {2021}
}

备注

Accepted by SLT 2021