Attentron:利用基于注意力的变长嵌入的少样本文本到语音合成
音频与语音处理
2020-08-13 v2 声音
摘要
由于个性化需求的增长,对所谓少样本 TTS 系统的需求正在浮现,该系统仅用少量数据即可克隆说话人。为解决此问题,我们提出 Attentron,一种在训练期间未见说话人声音上进行克隆的少样本 TTS 模型。它引入了两个特殊编码器,各自服务于不同目的。细粒度编码器通过注意力机制提取变长风格信息,粗粒度编码器极大稳定了语音合成,即便对未见说话人的语音合成也避免了不可理解的乱语。此外,该模型可扩展到任意数量的参考音频以改善合成语音的质量。根据我们的实验(包括人工评估),所提模型在为未见说话人生成语音时,在说话人相似度与质量方面显著优于最先进的模型。
引用
@article{arxiv.2005.08484,
title = {Attentron: Few-Shot Text-to-Speech Utilizing Attention-Based Variable-Length Embedding},
author = {Seungwoo Choi and Seungju Han and Dongyoung Kim and Sungjoo Ha},
journal= {arXiv preprint arXiv:2005.08484},
year = {2020}
}
备注
Accepted to INTERSPEECH 2020