中文

Equalizer:在神经音频编解码器中引入形状-增益分解

声音 2026-02-18 v1 人工智能

摘要

神经音频编解码器 (NAC) 通常在相同的潜空间中联合编码语音/音频信号的短期能量 (增益) 和归一化结构 (形状)。因此,它们对输入信号水平的全局变化不够稳健,因为此类变化对编码器输出的嵌入向量及其量化具有显著影响。这种方法本质上效率低下,导致码本冗余和次优的比特率-失真性能。为此,我们提出在 NAC 框架中引入形状-增益分解,这一在经典语音/音频编码中广泛使用的方法。Equalizer 方法的原理是将输入信号在短期基础上分解为增益和归一化形状向量。形状向量由 NAC 处理,而增益通过标量量化并单独传输。输出 (解码) 信号由 NAC 的归一化输出和量化后的增益重构。我们在语音信号上进行的实验表明,这种通用方法(易于适用于任何 NAC)实现了在比特率-失真性能和复杂度方面的显著提升。

关键词

引用

@article{arxiv.2602.15491,
  title  = {The Equalizer: Introducing Shape-Gain Decomposition in Neural Audio Codecs},
  author = {Samir Sadok and Laurent Girin and Xavier Alameda-Pineda},
  journal= {arXiv preprint arXiv:2602.15491},
  year   = {2026}
}

备注

Neural audio codecs, shape-gain decomposition, vector quantization, speech coding