中文

MusicHiFi:快速高保真立体声声码器

声音 2024-10-08 v4 音频与语音处理 信号处理

摘要

基于扩散的音频和音乐生成模型通常通过构建音频的图像表示(例如 mel 频谱图),然后使用相位重建模型或声码器将其转换为音频来执行生成。然而,典型的声码器只能产生较低分辨率(例如 16-24 kHz)的单声道音频,这限制了其实用性。我们提出了 MusicHiFi——一种高效的高保真立体声声码器。我们的方法采用由三个生成对抗网络(GANs)组成的级联,将低分辨率 mel 频谱图转换为音频,通过带宽扩展上采样为高分辨率音频,并上混为立体声音频。与以往的工作相比,我们提出了:1)用于我们级联每个阶段的统一的基于 GAN 的生成器和判别器架构及训练程序;2)一种新的快速、近乎与下采样兼容的带宽扩展模块;3)一种新的快速与下混兼容的单声道转立体声上混器,确保输出中单声道内容的保留。我们使用客观和主观听力测试评估了我们的方法,发现与以往的工作相比,我们的方法产生了相当或更好的音频质量、更好的空间化控制以及显著更快的推理速度。声音示例位于 \url{https://MusicHiFi.github.io/web/}。

关键词

引用

@article{arxiv.2403.10493,
  title  = {MusicHiFi: Fast High-Fidelity Stereo Vocoding},
  author = {Ge Zhu and Juan-Pablo Caceres and Zhiyao Duan and Nicholas J. Bryan},
  journal= {arXiv preprint arXiv:2403.10493},
  year   = {2024}
}

备注

Accepted to IEEE Signal Processing Letters