中文

STACodec:语义标记分配用于在声学保真度与语义信息之间进行平衡

音频与语音处理 2026-02-09 v1 计算与语言

摘要

神经音频编解码器广泛用于音频压缩,可集成到基于标记的语言模型中。传统编解码器能很好地保留声学细节,但缺乏语义信息。最近的混合编解码器通过蒸馏尝试包含语义信息,但这往往会降低重建性能,难以同时实现两者。为此,我们提出了 STACodec,一种统一的编解码器,通过语义标记分配(STA)将自监督学习(SSL)模型中的语义信息整合到残差向量量化(RVQ-1)的第一层。为进一步消除对 SSL 基于语义标记化器的依赖并提高推理期间的效率,我们提出了语义预蒸馏(SPD)模块,该模块在推理期间直接预测语义标记以分配给第一层 RVQ。实验结果表明,STACodec 在音频重建和下游语义任务方面均优于现有的混合编解码器,显示出更好地平衡声学保真度与语义能力。

关键词

引用

@article{arxiv.2602.06180,
  title  = {STACodec: Semantic Token Assignment for Balancing Acoustic Fidelity and Semantic Information in Audio Codecs},
  author = {Kaiyuan Zhang and Mohan Shi and Eray Eren and Natarajan Balaji Shankar and Zilai Wang and Abeer Alwan},
  journal= {arXiv preprint arXiv:2602.06180},
  year   = {2026}
}

备注

ICASSP 2026