中文

提升 X-Codec-2.0 多语言语音性能:25 Hz 隐层速率与 24 kHz 采样率

计算与语言 2026-03-10 v2 声音

摘要

X-Codec-2.0 在神经音频压缩和多语言语音建模方面表现突出,采用 50 Hz 隐层速率和 16 kHz 采样率,使用冻结的 HuBERT 特征。虽然有效,但该配置限制了时序效率和音频保真度。本文探索一种简单有效的修改方法,通过引入额外池化并增加解码器跳跃大小,从而将隐层速率从 50 Hz 降至 25 Hz,同时将输出采样率从 16 kHz 提升至 24 kHz,在不改变核心架构的前提下提升了效率和感知质量。基于 UTMOSv2 在多语言 Common Voice 17 测试集上的评估,所提出配置相较于原始 X-Codec-2.0 基线提升 0.29 MOS,且在所有运行于 25 Hz 的编解码器中实现最佳性能。源代码、模型权重及生成比较已发布于 https://huggingface.co/Scicom-intl/xcodec2-25TPS-24k。

关键词

引用

@article{arxiv.2601.20185,
  title  = {Improving X-Codec-2.0 for Multi-Lingual Speech: 25 Hz Latent Rate and 24 kHz Sampling},
  author = {Husein Zolkepli},
  journal= {arXiv preprint arXiv:2601.20185},
  year   = {2026}
}