中文

SpeechTokenizer:面向语音大语言模型的统一语音分词器

计算与语言 2024-01-24 v2 声音 音频与语音处理

摘要

当前的语音大语言模型构建于离散语音表征之上,这些表征可分为语义 token 与声学 token。然而,现有的语音 token 并非专为语音语言建模而设计。为评估语音 token 用于构建语音语言模型的适用性,我们建立了首个基准 SLMTokBench。结果表明,语义 token 与声学 token 均非理想选择。为此,我们提出 SpeechTokenizer,一种面向语音大语言模型的统一语音分词器。SpeechTokenizer 采用带残差向量量化(RVQ)的编码器-解码器架构。通过统一语义与声学 token,SpeechTokenizer 在不同 RVQ 层上分层解耦语音信息的不同方面。此外,我们利用 SpeechTokenizer 构建了统一语音语言模型(USLM)。实验显示,SpeechTokenizer 在语音重建上与 EnCodec 表现相当,并在 SLMTokBench 基准上展现出强劲性能。同时,USLM 在零样本文本转语音任务上优于 VALL-E。代码与模型见 https://github.com/ZhangXInFD/SpeechTokenizer/。

关键词

引用

@article{arxiv.2308.16692,
  title  = {SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models},
  author = {Xin Zhang and Dong Zhang and Shimin Li and Yaqian Zhou and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2308.16692},
  year   = {2024}
}

备注

Accepted by ICLR 2024. Project page is at https://0nutation.github.io/SpeechTokenizer.github.io/