面向文本到语音合成中零样本说话人自适应的内容相关细粒度说话人嵌入
声音
2022-11-14 v2 音频与语音处理
摘要
零样本说话人自适应旨在无需任何自适应时间和参数的情况下克隆未见说话人的声音。以往研究通常使用说话人编码器从参考语音中提取全局固定的说话人嵌入,也有一些尝试采用变长说话人嵌入。然而,它们忽略了迁移与音素内容相关的个人发音特征,导致在细节说话风格和发音习惯方面的说话人相似度较差。为提升说话人编码器建模个人发音特征的能力,我们提出用于零样本说话人自适应的内容相关细粒度说话人嵌入。分别从参考语音中提取对应的局部内容嵌入与说话人嵌入。我们引入一个参考注意力模块来建模参考语音与输入文本之间的内容相关性,并为每个音素编码器输出生成细粒度说话人嵌入,而非建模时间关系。实验结果表明,我们所提方法能够提升合成语音的说话人相似度,尤其对于未见说话人。
引用
@article{arxiv.2204.00990,
title = {Content-Dependent Fine-Grained Speaker Embedding for Zero-Shot Speaker Adaptation in Text-to-Speech Synthesis},
author = {Yixuan Zhou and Changhe Song and Xiang Li and Luwen Zhang and Zhiyong Wu and Yanyao Bian and Dan Su and Helen Meng},
journal= {arXiv preprint arXiv:2204.00990},
year = {2022}
}
备注
Accepted by Interspeech 2022