VoiceCraft:野外环境下的零样本语音编辑与文本到语音合成
音频与语音处理
2024-06-17 v3 人工智能
计算与语言
机器学习
声音
摘要
我们介绍了VoiceCraft,一个令牌填充神经编解码语言模型,它在有声书、网络视频和播客上的语音编辑和零样本文本到语音合成(TTS)任务中均达到了最先进的性能。VoiceCraft采用Transformer解码器架构,并引入了一种令牌重排过程,该过程结合了因果掩码和延迟堆叠,以实现在现有序列内进行生成。在语音编辑任务上,VoiceCraft生成的编辑后语音在自然度方面几乎与未编辑的录音无法区分,这一点已由人类评估证实;对于零样本TTS,我们的模型优于先前的最先进模型,包括VALLE和流行的商业模型XTTS-v2。至关重要的是,这些模型在具有挑战性和现实性的数据集上进行了评估,这些数据集包含多样的口音、说话风格、录音条件以及背景噪音和音乐,而我们的模型与其他模型和真实录音相比表现始终良好。特别是对于语音编辑评估,我们引入了一个高质量、具有挑战性且现实的数据集,名为RealEdit。我们鼓励读者在https://jasonppy.github.io/VoiceCraft_web上收听演示。
引用
@article{arxiv.2403.16973,
title = {VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild},
author = {Puyuan Peng and Po-Yao Huang and Shang-Wen Li and Abdelrahman Mohamed and David Harwath},
journal= {arXiv preprint arXiv:2403.16973},
year = {2024}
}
备注
ACL 2024. Data, code, and model weights are available at https://github.com/jasonppy/VoiceCraft