中文

RepCodec:一种用于语音令牌化的语音表征编解码器

音频与语音处理 2024-07-23 v3 机器学习 声音

摘要

随着大语言模型(LLM)近期的快速增长,离散语音令牌化在将语音注入 LLM 中发挥了重要作用。然而,这种离散化导致信息损失,进而损害整体性能。为提升这些离散语音令牌的性能,我们提出 RepCodec,一种用于语义语音令牌化的新型语音表征编解码器。与重建原始音频的音频编解码器不同,RepCodec 通过重建来自 HuBERT 或 data2vec 等语音编码器的语音表征来学习向量量化码本。语音编码器、编解码器编码器与向量量化码本共同构成将语音波形转换为语义令牌的流水线。大量实验表明,凭借增强的信息保留能力,RepCodec 在语音理解与生成上均显著优于广泛使用的 k-means 聚类方法。此外,该优势跨多种语音编码器与语言均成立,证实了 RepCodec 的鲁棒性。我们相信我们的方法可促进语音处理方面的大语言建模研究。

关键词

引用

@article{arxiv.2309.00169,
  title  = {RepCodec: A Speech Representation Codec for Speech Tokenization},
  author = {Zhichao Huang and Chutong Meng and Tom Ko},
  journal= {arXiv preprint arXiv:2309.00169},
  year   = {2024}
}

备注

ACL 2024 (Main)