中文

MagiCodec:面向高保真重建与生成的简单掩码高斯注入编解码器

声音 2025-06-03 v1 人工智能 机器学习 音频与语音处理

摘要

神经音频编解码器在将原始音频波形高效映射为离散 token 表示方面取得了显著进展,这是当代音频生成模型的基础。然而,大多数现有编解码器主要针对重建质量进行优化,往往牺牲了编码 token 的下游可建模性。受克服这一瓶颈的需求所驱动,我们引入了 MagiCodec\textbf{MagiCodec},一种新颖的单层、基于流式 Transformer 的音频编解码器。MagiCodec 采用了结合高斯噪声注入和潜空间正则化的多阶段训练流水线,明确旨在增强生成码的语义表达能力,同时保持高重建保真度。我们在频域上解析推导了噪声注入的效应,证明了其在衰减高频分量和促进鲁棒 token 化方面的有效性。大量实验评估表明,MagiCodec 在重建质量和下游任务上均超越了 SOTA 编解码器。值得注意的是,MagiCodec 生成的 token 表现出类似于自然语言的 Zipf 分布,从而提高了与基于语言模型的生成架构的兼容性。代码和预训练模型可在 https://github.com/Ereboas/MagiCodec 获取。

关键词

引用

@article{arxiv.2506.00385,
  title  = {MagiCodec: Simple Masked Gaussian-Injected Codec for High-Fidelity Reconstruction and Generation},
  author = {Yakun Song and Jiawei Chen and Xiaobin Zhuang and Chenpeng Du and Ziyang Ma and Jian Wu and Jian Cong and Dongya Jia and Zhuo Chen and Yuping Wang and Yuxuan Wang and Xie Chen},
  journal= {arXiv preprint arXiv:2506.00385},
  year   = {2025}
}

备注

18 pages, 3 figures. The code and pre-trained models are available at https://github.com/Ereboas/MagiCodec