提升 X-Codec-2.0 多语言语音性能:25 Hz 隐层速率与 24 kHz 采样率
计算与语言
2026-03-10 v2 声音
摘要
X-Codec-2.0 在神经音频压缩和多语言语音建模方面表现突出,采用 50 Hz 隐层速率和 16 kHz 采样率,使用冻结的 HuBERT 特征。虽然有效,但该配置限制了时序效率和音频保真度。本文探索一种简单有效的修改方法,通过引入额外池化并增加解码器跳跃大小,从而将隐层速率从 50 Hz 降至 25 Hz,同时将输出采样率从 16 kHz 提升至 24 kHz,在不改变核心架构的前提下提升了效率和感知质量。基于 UTMOSv2 在多语言 Common Voice 17 测试集上的评估,所提出配置相较于原始 X-Codec-2.0 基线提升 0.29 MOS,且在所有运行于 25 Hz 的编解码器中实现最佳性能。源代码、模型权重及生成比较已发布于 https://huggingface.co/Scicom-intl/xcodec2-25TPS-24k。
关键词
引用
@article{arxiv.2601.20185,
title = {Improving X-Codec-2.0 for Multi-Lingual Speech: 25 Hz Latent Rate and 24 kHz Sampling},
author = {Husein Zolkepli},
journal= {arXiv preprint arXiv:2601.20185},
year = {2026}
}