中文

SECodec:基于结构熵的压缩语音表示编解码器

声音 2025-01-03 v1 音频与语音处理

摘要

随着大型语言模型(LLM)的快速发展,离散语音表示变得至关重要,以便将语音集成到 LLM 中。现有方法依赖于预定义的词汇表大小和基于欧几里得距离的量化。然而,这些方法存在两个问题:其一,词汇表的大小是关键参数,影响编码器性能和下游任务训练效率;其二,基于欧几里得距离的量化在词汇表规模受控于合理范围时可能导致音频失真。事实上,在信息压缩领域,结构信息和熵引导至关重要,但以往方法大多忽视了这些因素。因此,本文从信息论角度出发,提出SECodec,一种基于结构熵(SE)的语音表示编解码器,用于构建语音语言模型。具体而言,我们首先将语音建模为图形,对图中语音特征节点进行聚类,并通过分层方式和解耦方式最小化二维结构熵(2D SE)提取对应的词汇表。随后,为解决音频失真问题,我们提出一种新型量化方法。该方法仍遵循2D SE最小化原则,自适应地为每个输入的原始语音节点选择最合适的标记。此外,我们开发了基于结构熵的语音语言模型(SESLM),利用SECodec。实验结果表明,SECodec在语音重建方面相当于EnCodec,而SESLM在零样本文本到语音任务中超越VALL-E。代码、示例语音、语音特征图、SE 词汇表以及模型均已公开于 https://github.com/wlq2019/SECodec。

关键词

引用

@article{arxiv.2501.00018,
  title  = {SECodec: Structural Entropy-based Compressive Speech Representation Codec for Speech Language Models},
  author = {Linqin Wang and Yaping Liu and Zhengtao Yu and Shengxiang Gao and Cunli Mao and Yuxin Huang and Wenjun Wang and Ling Dong},
  journal= {arXiv preprint arXiv:2501.00018},
  year   = {2025}
}

备注

Accepted to the Thirty-Ninth AAAI Conference on Artificial Intelligence (AAAI-25)