GC-TTS:基于几何约束的小样本说话人自适应
音频与语音处理
2021-08-17 v1 机器学习
声音
摘要
小样本说话人自适应是一种特定的文本到语音(TTS)系统,旨在利用少量训练数据复现新说话人的声音。尽管已有大量针对小样本说话人自适应系统的尝试,但在说话人相似度方面仍与目标说话人存在差距,且该差距取决于数据量。为弥补这一差距,我们提出了 GC-TTS,其实现了高质量说话人自适应,并显著提升了说话人相似度。具体而言,我们利用两种几何约束来学习具有判别性的说话人表征。在此,TTS 模型先在充足数据上针对基础说话人进行预训练,然后在几分钟数据上结合两种几何约束对新说话人进行微调。两种几何约束使模型能从有限数据中提取判别性说话人嵌入,从而合成可懂的语音。我们通过与主流且关键的方法进行比较,讨论并验证了 GC-TTS 的有效性。实验结果表明,GC-TTS 仅用几分钟训练数据即可生成高质量语音,在说话人相似度上优于标准技术。
引用
@article{arxiv.2108.06890,
title = {GC-TTS: Few-shot Speaker Adaptation with Geometric Constraints},
author = {Ji-Hoon Kim and Sang-Hoon Lee and Ji-Hyun Lee and Hong-Gyu Jung and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2108.06890},
year = {2021}
}
备注
Accepted paper in IEEE International Conference on Systems, Man, and Cybernetics (SMC 2021)