中文

OpenVoice:多功能的即时语音克隆

声音 2024-08-20 v6 机器学习 音频与语音处理

摘要

我们介绍了 OpenVoice,这是一种多功能的语音克隆方法,仅需参考说话人的短音频片段即可复制其声音并生成多种语言的语音。OpenVoice 在解决该领域以下开放挑战方面取得了重大进展:1) 灵活的语音风格控制。除了复制参考说话人的音色外,OpenVoice 还能实现对语音风格的细粒度控制,包括情感、口音、节奏、停顿和语调。语音风格并非直接复制自参考说话人的风格,也不受其约束。以往的方法在克隆后缺乏灵活操控语音风格的能力。2) 零样本跨语言语音克隆。OpenVoice 针对未包含在大规模说话人训练集中的语言,实现了零样本跨语言语音克隆。以往的方法通常需要针对所有语言的大规模说话人多语言 (MSML) 数据集,而 OpenVoice 无需任何该语言的大规模说话人训练数据即可将声音克隆到新语言中。OpenVoice 还具有很高的计算效率,其成本比性能甚至更差的商业 API 低数十倍。为了促进该领域的进一步研究,我们已将源代码和训练好的模型公开。我们还在演示网站上提供了定性结果。作为 MyShell.ai 的语音引擎,OpenVoice 已被全球超过 200 万用户使用。

关键词

引用

@article{arxiv.2312.01479,
  title  = {OpenVoice: Versatile Instant Voice Cloning},
  author = {Zengyi Qin and Wenliang Zhao and Xumin Yu and Xin Sun},
  journal= {arXiv preprint arXiv:2312.01479},
  year   = {2024}
}

备注

Technical Report