基于扩散模型的神经语音编解码器设计
声音
2025-04-14 v1 人工智能
多媒体
音频与语音处理
摘要
最近,训练为生成模型的神经语音编解码器(NSCs)在低比特率下显示出优于传统编解码器的优越性能。虽然大多数最先进的NSCs训练为生成对抗网络(GANs),但扩散模型(DMs)因其在图像生成方面相对于GANs的优越性能而成为具有潜力的替代方案。因此,DMs已成功应用于音频和语音编码等各种音频生成应用中。然而,扩散基的NSCs的设计尚未系统性地探索。我们通过三个贡献来解决这一问题。首先,我们提出一种基于DM条件和输出域的分类框架。这种简单的概念框架允许我们定义扩散基NSCs的设计空间,并将已有文献中的方法分配到相应类别。其次,我们在该概念框架内系统性地探索未开发的设计,通过创建和评估新的扩散基NSCs。最后,我们通过客观指标和主观听觉测试将提议的模型与现有的GAN和DM基线进行比较。
引用
@article{arxiv.2504.08470,
title = {On the Design of Diffusion-based Neural Speech Codecs},
author = {Pietro Foti and Andreas Brendel},
journal= {arXiv preprint arXiv:2504.08470},
year = {2025}
}