基于生成对抗网络的音频修复
音频与语音处理
2020-03-18 v1 机器学习
声音
机器学习
摘要
我们研究了 Wasserstein 生成对抗网络(WGAN)生成缺失音频内容的能力,该内容在上下文中(统计上相似)于声音及相邻边界。我们处理了使用 WGAN 模型进行音频修复长距离间隙(500 ms)的挑战。我们改进了修复部分的质量,提出了一种新的 WGAN 架构,其使用短程和长程相邻边界,相较于经典 WGAN 模型。性能在两种不同的音频乐器(钢琴和吉他)以及 virtuoso 钢琴家与弦乐 orchestra 上进行了比较。使用客观差异等级(ODG)来评估两种架构的性能。所提模型优于经典 WGAN 模型,并改善了高频内容的重建。此外,对于频率谱主要位于低频范围、小噪声对人耳较少烦扰且修复部分更易感知的乐器,我们获得了更好的结果。最后,我们能够表明,如果仅在该特定乐器上训练网络而忽略其他乐器,那么当某一特定乐器由其他乐器伴奏时,音频数据集获得了更好的测试结果。
引用
@article{arxiv.2003.07704,
title = {Audio inpainting with generative adversarial network},
author = {P. P. Ebner and A. Eltelt},
journal= {arXiv preprint arXiv:2003.07704},
year = {2020}
}