中文

Meta-Voice:基于元学习的快速少样本风格迁移表现力语音克隆

音频与语音处理 2021-11-16 v1 计算与语言 声音

摘要

文本到语音(TTS)合成中用于语音克隆的少样本风格迁移任务旨在利用极少量的中性数据,将任意源说话人的说话风格迁移到目标说话人的声音上。这是一项极具挑战性的任务,因为学习算法需要同时处理少样本语音克隆与说话人-韵律解耦。在实际应用中,加速对新目标说话人的适配过程十分重要,但也更具挑战性。本文中,我们采用元学习方法来解决这一困难的快速少样本风格迁移语音克隆任务。我们研究了模型无关元学习(MAML)算法,并将预训练的多说话人与多韵律基础 TTS 模型进行元迁移,使其对少样本适配高度敏感。采用域对抗训练机制与正交约束来解耦说话人与韵律表示,以实现有效的跨说话人风格迁移。实验结果表明,所提方法仅需目标说话人的 5 个样本(约 12 秒语音数据),经仅 100 步适配即可实现快速语音克隆。音频样本可在线获取。

关键词

引用

@article{arxiv.2111.07218,
  title  = {Meta-Voice: Fast few-shot style transfer for expressive voice cloning using meta learning},
  author = {Songxiang Liu and Dan Su and Dong Yu},
  journal= {arXiv preprint arXiv:2111.07218},
  year   = {2021}
}

备注

Pre-print technical report, 6 pages, 6 figures