中文

基于多频带扩散从离散表征生成高保真音频

声音 2023-11-09 v2 机器学习 音频与语音处理

摘要

深度生成模型能够以各类表征(如梅尔谱图、梅尔频率倒谱系数(MFCC))为条件生成高保真音频。近来,此类模型已被用于以高度压缩的表征为条件合成音频波形。尽管这些方法取得了令人印象深刻的成果,但当条件信息存在缺陷或不完美时,它们易于产生可听见的伪影。另一种建模方法是使用扩散模型。然而,这些模型主要被用作语音声码器(即以梅尔谱图为条件)或生成相对低采样率的信号。在本工作中,我们提出了一种基于高保真多频带扩散的框架,可从低比特率的离散表征生成任意类型的音频模态(如语音、音乐、环境声音)。在同等比特率下,所提方法在感知质量上优于最先进的生成技术。训练与评估代码以及音频样本已在 facebookresearch/audiocraft Github 页面上提供。

关键词

引用

@article{arxiv.2308.02560,
  title  = {From Discrete Tokens to High-Fidelity Audio Using Multi-Band Diffusion},
  author = {Robin San Roman and Yossi Adi and Antoine Deleforge and Romain Serizel and Gabriel Synnaeve and Alexandre Défossez},
  journal= {arXiv preprint arXiv:2308.02560},
  year   = {2023}
}

备注

10 pages