SpeechTokenizer:面向语音大语言模型的统一语音分词器
计算与语言
2024-01-24 v2 声音
音频与语音处理
摘要
当前的语音大语言模型构建于离散语音表征之上,这些表征可分为语义 token 与声学 token。然而,现有的语音 token 并非专为语音语言建模而设计。为评估语音 token 用于构建语音语言模型的适用性,我们建立了首个基准 SLMTokBench。结果表明,语义 token 与声学 token 均非理想选择。为此,我们提出 SpeechTokenizer,一种面向语音大语言模型的统一语音分词器。SpeechTokenizer 采用带残差向量量化(RVQ)的编码器-解码器架构。通过统一语义与声学 token,SpeechTokenizer 在不同 RVQ 层上分层解耦语音信息的不同方面。此外,我们利用 SpeechTokenizer 构建了统一语音语言模型(USLM)。实验显示,SpeechTokenizer 在语音重建上与 EnCodec 表现相当,并在 SLMTokBench 基准上展现出强劲性能。同时,USLM 在零样本文本转语音任务上优于 VALL-E。代码与模型见 https://github.com/ZhangXInFD/SpeechTokenizer/。
引用
@article{arxiv.2308.16692,
title = {SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models},
author = {Xin Zhang and Dong Zhang and Shimin Li and Yaqian Zhou and Xipeng Qiu},
journal= {arXiv preprint arXiv:2308.16692},
year = {2024}
}
备注
Accepted by ICLR 2024. Project page is at https://0nutation.github.io/SpeechTokenizer.github.io/