VoiceShop:一种保持身份的零样本语音编辑统一语音到语音框架
声音
2024-04-12 v2 人工智能
音频与语音处理
摘要
我们提出 VoiceShop,一种新颖的语音到语音框架,能够在单次前向传递中修改语音的多种属性(如年龄、性别、口音和语音风格),同时保持输入说话人的音色。以往的工作局限于只能单独编辑这些属性的专用模型,并存在以下缺陷:转换效果幅度弱、对分布外说话人没有零样本能力,或合成输出表现出不理想的音色泄漏。我们的工作在一个简单的模块化框架中为这些问题分别提出了解决方案,该框架基于条件扩散主干模型,带有可选的基于归一化流和序列到序列的说话人属性编辑模块,其组件可以在推理期间组合或移除,以满足广泛的任务需求而无需额外的模型微调。音频样本可在 \url{https://voiceshopai.github.io} 获取。
引用
@article{arxiv.2404.06674,
title = {VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing},
author = {Philip Anastassiou and Zhenyu Tang and Kainan Peng and Dongya Jia and Jiaxin Li and Ming Tu and Yuping Wang and Yuxuan Wang and Mingbo Ma},
journal= {arXiv preprint arXiv:2404.06674},
year = {2024}
}