中文

利用野外极少数据克隆个人声音

音频与语音处理 2021-10-11 v2 人机交互 声音

摘要

随着语音合成产品日益普及,工业界对个性化语音合成提出了更多要求:(1)如何使用低资源、易获取的数据克隆一个人的声音。(2)如何在克隆一个人声音的同时控制风格与韵律。为解决上述两个问题,我们提出了Hieratron模型框架,其中韵律与音色由两个模块分别建模,从而在生成语音时可实现对音色及音频其他特性的独立控制。实践表明,对于野外极少的目标说话人数据,Hieratron相较传统方法具有明显优势,除可控制生成语音的风格与语言外,生成语音在语音质量上的平均意见得分也提升了0.2分以上。

关键词

引用

@article{arxiv.2110.03347,
  title  = {Cloning one's voice using very limited data in the wild},
  author = {Dongyang Dai and Yuanzhe Chen and Li Chen and Ming Tu and Lu Liu and Rui Xia and Qiao Tian and Yuping Wang and Yuxuan Wang},
  journal= {arXiv preprint arXiv:2110.03347},
  year   = {2021}
}