UniCodec:面向多语种音频的统一音频编解码器 with Single Domain-Adaptive Codebook
音频与语音处理
2025-02-28 v1 声音
摘要
神经音频编解码器的出现为音频语言模型提供了动力,这些编解码器在连续波形与与语言模型范式相容的离散标记之间建立了关键映射。从多层残差向量量化器到单层量化器的演化趋势有利于语言自回归解码。然而,能够通过单一码本处理多域音频信号的能力仍受制于域间分布差异。本文引入 UniCodec,一种支持多域音频数据(包括语音、音乐和语音)的统一音频编解码器 with Single Codebook。为实现这一目标,我们提出了分区域自适应码本方法和域Mixture-of-Experts策略以捕获每个音频域的独特特征。此外,为在无辅助模块的情况下丰富编解码器的语义密度,我们提出了自监督掩码预测建模方法。综合的客观和主观评估表明,UniCodec 在三个音频域之间实现了卓越的音频重建性能,优于现有的单码本统一神经编解码器,甚至在声学和语义表示能力上超越了最先进的领域特定编解码器。
引用
@article{arxiv.2502.20067,
title = {UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook},
author = {Yidi Jiang and Qian Chen and Shengpeng Ji and Yu Xi and Wen Wang and Chong Zhang and Xianghu Yue and ShiLiang Zhang and Haizhou Li},
journal= {arXiv preprint arXiv:2502.20067},
year = {2025}
}
备注
12 pages, 9 tables