中文

基于因子化RVQ-GAN的无缝分离语音标记

音频与语音处理 2025-06-19 v1 计算与语言 声音

摘要

我们提出了层次化音频编解码器(Hierarchical Audio Codec, HAC),是一个统一的神经语音编解码器,将其瓶颈分解为三个语言层次——声学层、音素层和词汇层——于单个模型中。HAC利用两种知识蒸馏目标:一种来自预训练语音编码器(HuBERT)用于音素级结构,另一种来自基于文本的编码器(LaBSE)用于词汇线索。在英语和多语言数据上的实验表明,HAC的分解瓶颈产生了无缝分离的标记集合:一个与音素对齐,另一个捕获词汇级语义。定量评估确认HAC标记保留了自然性并提供了可解释的语言信息, 在无缝分离和重构质量方面均优于单层基线。这一发现凸显了HAC作为统一离散语音表示的潜力,能够在下游语音生成和理解任务中桥接声学细节与词汇含义。

关键词

引用

@article{arxiv.2506.15456,
  title  = {Factorized RVQ-GAN For Disentangled Speech Tokenization},
  author = {Sameer Khurana and Dominik Klement and Antoine Laurent and Dominik Bobos and Juraj Novosad and Peter Gazdik and Ellen Zhang and Zili Huang and Amir Hussein and Ricard Marxer and Yoshiki Masuyama and Ryo Aihara and Chiori Hori and Francois G. Germain and Gordon Wichern and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:2506.15456},
  year   = {2025}
}

备注

Accepted to Interspeech 2025