中文

零样本歌唱语音转换:基于聚类的音素表示

声音 2024-10-15 v2 音频与语音处理

摘要

本研究提出了一种创新的零样本任意到任意歌唱语音转换方法,利用一种新颖的基于聚类的音素表示来有效分离内容、音色和演唱风格。该方法能够精确操控语音特征。我们发现每位艺术家录音较少的数据集更容易出现音色泄露。在超过 10,000 小时的演唱数据和用户反馈上的广泛测试表明,我们的模型显著提升了音质和音色准确度,符合我们的目标并推动了语音转换技术的发展。此外,本研究推进了零样本 SVC,并为未来在离散语音表示方面的工作奠定了基础,强调了韵脚的保留。

关键词

引用

@article{arxiv.2409.08039,
  title  = {Zero-Shot Sing Voice Conversion: built upon clustering-based phoneme representations},
  author = {Wangjin Zhou and Fengrun Zhang and Yiming Liu and Wenhao Guan and Yi Zhao and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:2409.08039},
  year   = {2024}
}