从粗到细:通过多尺度语音编码与生成改进神经音codec语言模型
声音
2024-09-19 v1 音频与语音处理
摘要
神经音codec语言模型(CLM)在文本到语音(TTS)合成中展现出卓越的性能。然而,受到“近期偏见”问题的困扰,CLM 对更高时间尺度上的粗粒度信息关注不足,常常产生不自然甚至无法理解的语音。本工作提出了 CoFi-Speech,一种粗到细 CLM-TTS 方法,采用多尺度语音编码与生成以解决此问题。我们训练了多尺度神经音codec,CoFi-Codec,将语音编码为由多个不同时间分辨率的 token 序列组成的多尺度离散表示。随后,我们提出 CoFi-LM 能够以两种模式生成该表示:基于单一 LM 的链式尺度生成和基于多个 LM 的叠加尺度生成。在实验中,CoFi-Speech 在零样本 TTS 中的自然度和说话人相似度方面显著优于单尺度基线系统。多尺度编码的分析表明,CoFi-Codec 在保持高质量语音重建的同时,有效学习了多尺度离散语音表示。特别是对于叠加尺度方法,粗到细的多尺度生成也被证明是追求高质量 TTS 神经音codec语言模型的关键方法。
引用
@article{arxiv.2409.11630,
title = {Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation},
author = {Haohan Guo and Fenglong Xie and Dongchao Yang and Xixin Wu and Helen Meng},
journal= {arXiv preprint arXiv:2409.11630},
year = {2024}
}