中文

通过主方向发现实现人工说话人嵌入的可控生成

声音 2023-10-27 v1 机器学习 音频与语音处理

摘要

在语音合成系统中,利用直观且细粒度的控制来自定义声音和说话风格具有挑战性,因为带有适当标注的可用数据很少。此外,编辑现有人类的声音也带来伦理问题。本文提出一种生成人工说话人嵌入的方法,这些嵌入无法关联到真实人类,同时提供对嵌入声音和说话风格的直观、细粒度控制,且不需要任何说话人或风格的标注。这些人工且可控的嵌入可输入语音合成系统,该系统在训练时以真实人类的嵌入为条件,从而在推理时不牺牲隐私。

关键词

引用

@article{arxiv.2310.17502,
  title  = {Controllable Generation of Artificial Speaker Embeddings through Discovery of Principal Directions},
  author = {Florian Lux and Pascal Tilli and Sarina Meyer and Ngoc Thang Vu},
  journal= {arXiv preprint arXiv:2310.17502},
  year   = {2023}
}

备注

Published at ISCA Interspeech 2023 https://www.isca-speech.org/archive/interspeech_2023/lux23_interspeech.html