中文

基于生成对抗网络的音频修复

音频与语音处理 2020-03-18 v1 机器学习 声音 机器学习

摘要

我们研究了 Wasserstein 生成对抗网络(WGAN)生成缺失音频内容的能力,该内容在上下文中(统计上相似)于声音及相邻边界。我们处理了使用 WGAN 模型进行音频修复长距离间隙(500 ms)的挑战。我们改进了修复部分的质量,提出了一种新的 WGAN 架构,其使用短程和长程相邻边界,相较于经典 WGAN 模型。性能在两种不同的音频乐器(钢琴和吉他)以及 virtuoso 钢琴家与弦乐 orchestra 上进行了比较。使用客观差异等级(ODG)来评估两种架构的性能。所提模型优于经典 WGAN 模型,并改善了高频内容的重建。此外,对于频率谱主要位于低频范围、小噪声对人耳较少烦扰且修复部分更易感知的乐器,我们获得了更好的结果。最后,我们能够表明,如果仅在该特定乐器上训练网络而忽略其他乐器,那么当某一特定乐器由其他乐器伴奏时,音频数据集获得了更好的测试结果。

关键词

引用

@article{arxiv.2003.07704,
  title  = {Audio inpainting with generative adversarial network},
  author = {P. P. Ebner and A. Eltelt},
  journal= {arXiv preprint arXiv:2003.07704},
  year   = {2020}
}