中文

用于 M2VoC 挑战赛的 AS-NU 系统

音频与语音处理 2021-04-08 v1 机器学习 声音

摘要

本文描述了用于多说话人多风格语音克隆挑战赛(M2VoC)两个赛道的 AS-NU 系统。第一赛道侧重于使用少量 100 条目标语句进行语音克隆,而第二赛道侧重于仅使用 5 条目标语句进行语音克隆。由于第二赛道数据严重缺乏,我们从 TTS 系统的训练数据中选择了与目标说话人最相似的说话人,并使用该说话人的语句和给定的 5 条目标语句来微调我们的模型。评估结果显示,我们的两个赛道系统在质量上表现相似,但第二赛道的相似度得分与第一赛道的相似度得分之间仍存在明显差距。

关键词

引用

@article{arxiv.2104.03009,
  title  = {The AS-NU System for the M2VoC Challenge},
  author = {Cheng-Hung Hu and Yi-Chiao Wu and Wen-Chin Huang and Yu-Huai Peng and Yu-Wen Chen and Pin-Jui Ku and Tomoki Toda and Yu Tsao and Hsin-Min Wang},
  journal= {arXiv preprint arXiv:2104.03009},
  year   = {2021}
}