中文

2021年多说话人多风格语音克隆挑战赛

音频与语音处理 2021-04-06 v1

摘要

多说话人多风格语音克隆挑战赛(M2VoC)旨在为流行的语音克隆任务基准测试提供一个通用的规模化数据集以及公平的测试平台。具体而言,我们将该挑战赛设定为:利用目标说话人的有限数据,将平均 TTS 模型适配到风格化目标语音,并通过说话人身份与风格相似度进行评估。挑战赛包含两条赛道,即少样本赛道和单样本赛道,参与者需分别使用 100 和 5 个样本克隆多个目标语音。每条赛道还设有两个子赛道。对于子赛道 a,为公平比较不同策略,参与者被严格限制仅可使用组织者提供的训练数据。对于子赛道 b,参与者可使用任何公开可用数据。本文中,我们详细说明了挑战赛的任务与所用数据,随后对提交的系统及评估结果进行总结。

关键词

引用

@article{arxiv.2104.01818,
  title  = {The Multi-speaker Multi-style Voice Cloning Challenge 2021},
  author = {Qicong Xie and Xiaohai Tian and Guanghou Liu and Kun Song and Lei Xie and Zhiyong Wu and Hai Li and Song Shi and Haizhou Li and Fen Hong and Hui Bu and Xin Xu},
  journal= {arXiv preprint arXiv:2104.01818},
  year   = {2021}
}

备注

has been accepted to ICASSP 2021