STACodec:语义标记分配用于在声学保真度与语义信息之间进行平衡
音频与语音处理
2026-02-09 v1 计算与语言
摘要
神经音频编解码器广泛用于音频压缩,可集成到基于标记的语言模型中。传统编解码器能很好地保留声学细节,但缺乏语义信息。最近的混合编解码器通过蒸馏尝试包含语义信息,但这往往会降低重建性能,难以同时实现两者。为此,我们提出了 STACodec,一种统一的编解码器,通过语义标记分配(STA)将自监督学习(SSL)模型中的语义信息整合到残差向量量化(RVQ-1)的第一层。为进一步消除对 SSL 基于语义标记化器的依赖并提高推理期间的效率,我们提出了语义预蒸馏(SPD)模块,该模块在推理期间直接预测语义标记以分配给第一层 RVQ。实验结果表明,STACodec 在音频重建和下游语义任务方面均优于现有的混合编解码器,显示出更好地平衡声学保真度与语义能力。
引用
@article{arxiv.2602.06180,
title = {STACodec: Semantic Token Assignment for Balancing Acoustic Fidelity and Semantic Information in Audio Codecs},
author = {Kaiyuan Zhang and Mohan Shi and Eray Eren and Natarajan Balaji Shankar and Zilai Wang and Abeer Alwan},
journal= {arXiv preprint arXiv:2602.06180},
year = {2026}
}
备注
ICASSP 2026