中文

基于低比特率神经编解码器与预训练表征的通用语音标记学习

声音 2025-10-16 v2 人工智能 音频与语音处理

摘要

当前大型语音语言模型主要基于从自监督学习表征离散化得到的语义标记与来自神经编解码器的声学标记,遵循语义建模与声学合成范式。然而,语义标记丢弃了对自然语音交际至关重要的语音属性 (paralinguistic attributes),而基于语义标记的声学合成在恢复语音属性方面受限且面临鲁棒性问题,尤其在提示与目标之间存在领域差距时。本文统一两种标记类型,提出 UniCodec—a种封装语音全部语义(包括语言与语音属性)于紧凑且语义解耦统一标记的通用语音标记学习方法。该统一标记不仅能为语音语言模型在带有语音属性提示下的理解提供支持,也能为语音生成提供高质量输出。我们利用低比特率神经编解码器在全局与局部尺度上学习解耦离散表征,并从自监督学习特征中进行知识蒸馏。大量评估表明,在多语言数据集上,UniCodec 在多种语音处理任务中表现出有效,能够生成自然、富有表现力且长期一致的输出,同时良好保留语音属性。

关键词

引用

@article{arxiv.2503.12115,
  title  = {Universal Speech Token Learning via Low-Bitrate Neural Codec and Pretrained Representations},
  author = {Xue Jiang and Xiulian Peng and Yuan Zhang and Yan Lu},
  journal= {arXiv preprint arXiv:2503.12115},
  year   = {2025}
}

备注

Accepted by IEEE Journal of Selected Topics in Signal Processing(JSTSP)