通过主方向发现实现人工说话人嵌入的可控生成
声音
2023-10-27 v1 机器学习
音频与语音处理
摘要
在语音合成系统中,利用直观且细粒度的控制来自定义声音和说话风格具有挑战性,因为带有适当标注的可用数据很少。此外,编辑现有人类的声音也带来伦理问题。本文提出一种生成人工说话人嵌入的方法,这些嵌入无法关联到真实人类,同时提供对嵌入声音和说话风格的直观、细粒度控制,且不需要任何说话人或风格的标注。这些人工且可控的嵌入可输入语音合成系统,该系统在训练时以真实人类的嵌入为条件,从而在推理时不牺牲隐私。
引用
@article{arxiv.2310.17502,
title = {Controllable Generation of Artificial Speaker Embeddings through Discovery of Principal Directions},
author = {Florian Lux and Pascal Tilli and Sarina Meyer and Ngoc Thang Vu},
journal= {arXiv preprint arXiv:2310.17502},
year = {2023}
}
备注
Published at ISCA Interspeech 2023 https://www.isca-speech.org/archive/interspeech_2023/lux23_interspeech.html