中文

GACELA——一种用于长音频修复的生成对抗上下文编码器

声音 2021-06-10 v1 音频与语音处理 机器学习

摘要

我们提出 GACELA,一种生成对抗网络(GAN),旨在恢复时长在数百毫秒至数秒之间的缺失音乐音频数据,即执行长间隙音频修复。先前工作要么处理更短的间隙,要么通过从其他信号部分复制可用信息来依赖样本示例,而 GACELA 从两方面处理长间隙修复。首先,它依靠五个具有递增感受野分辨率的并行判别器来考虑音频信息的多种时间尺度。其次,它不仅以间隙周围的可用信息即上下文为条件,还以条件 GAN 的潜变量为条件。这解决了此类长间隙下音频修复固有的多模态性,并提供了用户自定义修复的选项。GACELA 在针对复杂度各异的音乐信号以及 375~ms 至 1500~ms 间隙时长的听音测试中进行了测试。尽管受试者常能察觉修复痕迹,但伪影的严重性从不可接受降至轻微干扰。GACELA 代表了一个能够集成未来改进的框架,例如处理更具听觉相关性的特征或更明确的音乐特征。

关键词

引用

@article{arxiv.2005.05032,
  title  = {GACELA -- A generative adversarial context encoder for long audio inpainting},
  author = {Andres Marafioti and Piotr Majdak and Nicki Holighaus and Nathanaël Perraudin},
  journal= {arXiv preprint arXiv:2005.05032},
  year   = {2021}
}