Vec-Tok Speech:面向神经语音生成的语音向量化与标记化
声音
2023-10-13 v2 音频与语音处理
摘要
语言模型(LMs)近来在自然语言处理和计算机视觉中蓬勃发展,在各种任务中生成高保真文本或图像。相比之下,当前的语音生成模型在语音质量和任务泛化方面仍面临困境。本文提出 Vec-Tok Speech,一个可扩展的框架,能够类比多种语音生成任务,生成富有表现力且高保真的语音。具体而言,我们提出了一种基于语音向量和语义标记的新型语音编解码器。语音向量包含有助于高保真语音重建的声学细节,而语义标记聚焦于语音的语言内容,便于语言建模。基于所提出的语音编解码器,Vec-Tok Speech 利用一个 LM 承担语音生成的核心。此外,引入字节对编码(BPE)以降低标记长度和比特率,从而减小暴露偏差并扩大上下文覆盖,提升 LMs 的性能。Vec-Tok Speech 可用于语内与跨语言零样本语音转换(VC)、零样本说话风格迁移文本转语音(TTS)、语音到语音翻译(S2ST)、语音降噪以及说话人去标识与匿名化。实验表明,基于 5 万小时语音构建的 Vec-Tok Speech 性能优于其他 SOTA 模型。代码将发布于 https://github.com/BakerBunker/VecTok 。
引用
@article{arxiv.2310.07246,
title = {Vec-Tok Speech: speech vectorization and tokenization for neural speech generation},
author = {Xinfa Zhu and Yuanjun Lv and Yi Lei and Tao Li and Wendi He and Hongbin Zhou and Heng Lu and Lei Xie},
journal= {arXiv preprint arXiv:2310.07246},
year = {2023}
}
备注
15 pages, 2 figures