具有时不变码的少令牌神经语音编解码器
声音
2024-03-12 v2 音频与语音处理
摘要
基于语言模型的文本到语音(TTS)模型,如 VALL-E,因其在零样本场景下出色的上下文学习能力而受到关注。神经语音编解码器是这些模型的关键组件,可将语音转换为离散令牌表示。然而,编解码器生成的过长令牌序列可能对预测精度产生负面影响,并制约基于语言模型的 TTS 模型的发展。为解决此问题,本文提出一种具有时不变码的新型神经语音编解码器 TiCodec。通过将时不变信息编码并量化为独立码,TiCodec 可减少需编码的帧级信息量,有效降低作为语音码的令牌数量。此外,本文引入时不变编码一致性损失,以增强同一话语内时不变码的一致性并迫使其捕获更多全局信息,从而有益于零样本 TTS 任务。实验结果表明,TiCodec 不仅能以更少令牌提升重建语音质量,还能提高相似度与自然度,并降低 TTS 模型合成语音的词错误率。
引用
@article{arxiv.2310.00014,
title = {Fewer-token Neural Speech Codec with Time-invariant Codes},
author = {Yong Ren and Tao Wang and Jiangyan Yi and Le Xu and Jianhua Tao and Chuyuan Zhang and Junzuo Zhou},
journal= {arXiv preprint arXiv:2310.00014},
year = {2024}
}
备注
Accepted by ICASSP 2024