中文

基于动态卷积注意力的零样本长文本语音克隆

音频与语音处理 2022-01-27 v2 计算与语言 机器学习 声音

摘要

随着语音克隆的最新进展,目标说话人的语音合成性能已可达到接近人类水平。然而,自回归语音克隆系统仍受文本对齐失败之苦,导致无法合成长句。本工作中,我们提出了一种基于注意力的文本到语音系统的变体,可从几秒参考语音中复现目标声音,并泛化到极长语句。所提系统基于三个独立训练的组件:说话人编码器、合成器和通用声码器。对长语句的泛化通过使用一种称为动态卷积注意力(Dynamic Convolution Attention)的基于能量的注意力机制,结合基于 Tacotron 2 为合成器提出的一组修改来实现。此外,通过对合成器和声码器均以在大型多样数据上预训练的说话人编码器为条件,实现了有效的零样本说话人自适应。我们从语音自然度、说话人相似度、对齐一致性和长语句合成能力方面比较了若干语音克隆系统实现,并得出结论:所提模型能为极长语句生成可懂合成语音,同时在短文本上保持较高自然度与相似度。

关键词

引用

@article{arxiv.2201.10375,
  title  = {Zero-Shot Long-Form Voice Cloning with Dynamic Convolution Attention},
  author = {Artem Gorodetskii and Ivan Ozhiganov},
  journal= {arXiv preprint arXiv:2201.10375},
  year   = {2022}
}

备注

Added article structure