一种利用少量无文本样本的新型跨语言语音克隆方法
音频与语音处理
2019-10-31 v2 计算与语言
声音
摘要
本文提出了一种跨语言语音克隆方法。由 SI-ASR 模型获得的 BN 特征被用作跨越说话人和语言边界的桥梁。文本与 BN 特征之间的关系由潜在韵律模型建模。声学模型学习从 BN 特征到声学特征的转换。通过对目标说话人的少量样本进行微调,声学模型实现了语音克隆。该系统能够以跨语言说话人的声音生成目标语言的任意话语语音。我们验证了该方法在少量音频数据下也能很好地处理跨语言任务。而在同语言任务中,我们提出的方法在自然度和相似度方面也优于基线方法。
引用
@article{arxiv.1910.13276,
title = {a novel cross-lingual voice cloning approach with a few text-free samples},
author = {Xinyong Zhou and Hao Che and Xiaorui Wang and Lei Xie},
journal= {arXiv preprint arXiv:1910.13276},
year = {2019}
}
备注
Submitted to ICASSP 2020