中文

MFCC-GAN 编解码器:一种基于 AI 的新型音频编码

音频与语音处理 2023-10-24 v1 声音

摘要

本文中,我们提出了在对抗设定下利用 MFCC 特征的基于 AI 的音频编码。我们将常规编码器与对抗学习解码器结合以更好地重建原始波形。由于 GAN 给出隐式密度估计,因此此类模型更不易过拟合。我们将我们的工作与五种知名编解码器(即 AAC、AC3、Opus、Vorbis 与 Speex)进行比较,比特率覆盖 2kbps 至 128kbps。尽管比特率低于 AC3_128k、AAC_112k、Vorbis_48k、Opus_48k 与 Speex_48K,MFCCGAN_36k 在 SNR 方面取得了 SOTA 结果。另一方面,MFCCGAN_13k 也取得了 SNR=27 的高值,等同于 AC3_128k 与 AAC_112k,而比特率显著更低(13 kbps)。MFCCGAN_36k 相比 AAC_48k 取得了更高的 NISQA-MOS 结果,同时比特率低 20%。此外,MFCCGAN_13k 获得 NISQAMOS= 3.9,远高于 AAC_24k、AAC_32k、AC3_32k 与 AAC_48k。作为未来工作,我们最后建议在 MFCCGAN 结构中采用优化可懂度与感知度量的损失函数,以同时提升质量与可懂度。

关键词

引用

@article{arxiv.2310.14300,
  title  = {MFCC-GAN Codec: A New AI-based Audio Coding},
  author = {Mohammad Reza Hasanabadi},
  journal= {arXiv preprint arXiv:2310.14300},
  year   = {2023}
}

备注

Accepted in ABU Technical Review journal 2023/3