MDCTCodec: 一种面向高采样率与低比特率场景的轻量级MDCT神经音频编解码器
声音
2024-11-04 v1 音频与语音处理
摘要
在本文中,我们提出了MDCTCodec,一种基于修正离散余弦变换(MDCT)的高效轻量级端到端神经音频编解码器。编码器以音频的MDCT谱作为输入,将其编码为连续潜在码,再由残差向量量化器(RVQ)进行离散化。随后,解码器从量化潜在码中解码MDCT谱,并通过逆MDCT重构音频。在训练阶段,采用了一种新颖的多分辨率MDCT判别器(MR-MDCTD)来判别自然或解码后的MDCT谱,以进行对抗训练。实验结果表明,在高采样率和低比特率场景下,MDCTCodec相较于基线编解码器展现出高解码音频质量、改进的训练与生成效率以及紧凑的模型规模。具体而言,MDCTCodec在公共VCTK语料库上以48 kHz采样率和6 kbps比特率取得了4.18的ViSQOL分数。
引用
@article{arxiv.2411.00464,
title = {MDCTCodec: A Lightweight MDCT-based Neural Audio Codec towards High Sampling Rate and Low Bitrate Scenarios},
author = {Xiao-Hang Jiang and Yang Ai and Rui-Chen Zheng and Hui-Peng Du and Ye-Xin Lu and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2411.00464},
year = {2024}
}
备注
Accepted by 2024 IEEE Spoken Language Technology Workshop (SLT2024)