中文

LLM-Codec:神经音频编解码器与语言模型目标的融合

声音 2026-04-21 v1

摘要

神经音频编解码器广泛用作口语语言模型的标记化器,但其优化目标是波形重建而非自回归预测。这种不匹配会将声学驱动的不确定性注入离散标记空间,并增加语言模型的困惑度。我们提出了\ours方案,通过在编解码器训练中引入语言模型导向的目标,同时保持编解码器和LLM架构不变。\ours引入了(i)基于Medusa风格的多步骤预测头,以鼓励多步骤可预测性;(ii)语义对齐,通过记忆库对比损失匹配音频与文本表示。可微Gumbel桥接 enables 将这些目标的端到端梯度传播到编解码器编码器。实验表明,在SALMon语音连贯性指标上,使用\ours训练的标记语言模型准确率达61.6%(相较于AUV提升12.1分),而困惑度降低35%。在Codec-SUPERB-tiny上,\ours相较于AUV将语音Mel距离提高5.0%,同时实现了可学习性提升,证明了重建保真度与标记可预测性可以同步提升。

关键词

引用

@article{arxiv.2604.17852,
  title  = {LLM-Codec: Neural Audio Codec Meets Language Model Objectives},
  author = {Ho-Lam Chung and Yiming Chen and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2604.17852},
  year   = {2026}
}

备注

ACL2026 Finding