HALL-E:面向分钟级零样本文本到语音合成的层次神经编解码语言模型
音频与语音处理
2024-10-11 v1 声音
摘要
最近,基于大语言模型(LLM)的文本到语音(TTS)模型因将自然语言文本翻译为离散音频 token 序列而受到广泛关注,随着使用残差向量量化(RVQ)的神经音频编解码(NAC)模型取得进展。然而,由于高帧率导致音频 token 长度显著增加,使得即使只有一分钟的语音也难以用自回归语言模型生成音频 token。为此,本文引入两种新型后训练方法:1) 多分辨率重量化(MReQ)和2) HALL-E。MReQ 是一种降低预训练 NAC 模型帧率的框架,具体采用多分辨率残差向量量化(MRVQ)模块通过教师-学生蒸馏层次化重组织离散音频 token。HALL-E 是一个基于 LLM 的 TTS 模型,用于预测 MReQ 的层次化 token。具体而言,它采用 MRVQ 子模块的技术,并继续在预训练 LLM 基座 TTS 模型上进行训练。此外,为推动 TTS 研究,我们构建了 MinutesSpeech 数据集,包含 4 万小时筛选后的语音数据,用于训练和评估时长从 3 秒到 180 秒的语音合成。实验表明,我们的后训练框架在 VALL-E 上取得显著效果,将帧率降至最低可达 8 Hz,实现单步推理下的稳定分钟级语音合成。音频样本、数据集、代码及预训练模型已在 https://yutonishimura-v2.github.io/HALL-E_DEMO/ 提供。
引用
@article{arxiv.2410.04380,
title = {HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis},
author = {Yuto Nishimura and Takumi Hirose and Masanari Ohi and Hideki Nakayama and Nakamasa Inoue},
journal= {arXiv preprint arXiv:2410.04380},
year = {2024}
}