EuleroDec:面向高效鲁棒音频编码的复值 RVQ-VAE
声音
2026-01-29 v2 机器学习
音频与语音处理
摘要
音频编解码器通过将 PCM 音频压缩至对带宽友好的比特率,为离散音乐生成建模、音乐流媒体和沉浸式媒体提供支持。近期的研究倾向于在频谱域进行处理;然而,频谱图域通常难以处理相位建模,而相位本质上是复值的。大多数频域神经编解码器要么忽略相位信息,要么将其编码为两个独立的实值通道,从而限制了空间保真度。这导致需要引入对抗判别器,以牺牲收敛速度和训练稳定性为代价,来补偿音频信号表示能力的不足。在本工作中,我们提出了一种端到端的复值 RVQ-VAE 音频编解码器,它在整个分析-量化-合成流程中保持了幅度-相位耦合,并移除了对抗判别器和扩散后滤波器。在不使用 GAN 或扩散模型的情况下,我们在域内匹配或超越了训练时间长得多的基线模型,并在域外达到了 SOTA 性能。与训练数十万步的标准基线相比,我们的模型将训练预算降低了一个数量级,在保持高感知质量的同时显著提升了计算效率。
引用
@article{arxiv.2601.17517,
title = {EuleroDec: A Complex-Valued RVQ-VAE for Efficient and Robust Audio Coding},
author = {Luca Cerovaz and Michele Mancusi and Emanuele Rodolà},
journal= {arXiv preprint arXiv:2601.17517},
year = {2026}
}
备注
Accepted at ICASSP 2026