中文

VoiceCraft:野外环境下的零样本语音编辑与文本到语音合成

音频与语音处理 2024-06-17 v3 人工智能 计算与语言 机器学习 声音

摘要

我们介绍了VoiceCraft,一个令牌填充神经编解码语言模型,它在有声书、网络视频和播客上的语音编辑和零样本文本到语音合成(TTS)任务中均达到了最先进的性能。VoiceCraft采用Transformer解码器架构,并引入了一种令牌重排过程,该过程结合了因果掩码和延迟堆叠,以实现在现有序列内进行生成。在语音编辑任务上,VoiceCraft生成的编辑后语音在自然度方面几乎与未编辑的录音无法区分,这一点已由人类评估证实;对于零样本TTS,我们的模型优于先前的最先进模型,包括VALLE和流行的商业模型XTTS-v2。至关重要的是,这些模型在具有挑战性和现实性的数据集上进行了评估,这些数据集包含多样的口音、说话风格、录音条件以及背景噪音和音乐,而我们的模型与其他模型和真实录音相比表现始终良好。特别是对于语音编辑评估,我们引入了一个高质量、具有挑战性且现实的数据集,名为RealEdit。我们鼓励读者在https://jasonppy.github.io/VoiceCraft_web上收听演示。

关键词

引用

@article{arxiv.2403.16973,
  title  = {VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild},
  author = {Puyuan Peng and Po-Yao Huang and Shang-Wen Li and Abdelrahman Mohamed and David Harwath},
  journal= {arXiv preprint arXiv:2403.16973},
  year   = {2024}
}

备注

ACL 2024. Data, code, and model weights are available at https://github.com/jasonppy/VoiceCraft