基于一维算子类 GAN 的真实世界音频盲复原
声音
2023-01-23 v2 机器学习
音频与语音处理
摘要
目的:尽管文献中提出了大量音频复原研究,但大多数聚焦于去噪或去混响等孤立的复原问题,忽略了其他伪影。此外,假设具有有限数量固定信号失真比(SDR)水平的噪声或混响环境是常见做法。然而,真实世界音频常受到混响、传感器噪声和背景音频混合等多种伪影的污染,且类型、严重度和持续时间各异。在本研究中,我们提出一种基于算子类生成对抗网络(Operational GANs,Op-GANs)的真实世界音频信号盲复原新方法,结合时域与频域客观指标,以提升复原音频信号的质量,而不受其污染伪影的类型与严重度影响。方法:使用一维 Operational-GANs,其生成神经元模型针对任意受损音频信号的盲复原进行了优化。结果:所提方法在基准 TIMIT-RAR(语音)和 GTZAN-RAR(非语音)数据集上进行了广泛评估,这些数据集被随机混合的伪影以随机严重度污染以模拟真实世界音频信号。分别实现了超过 7.2 dB 和 4.9 dB 的平均 SDR 提升,与基线方法相比提升显著。意义:这是盲音频复原的先驱研究,具有直接(时域)复原真实世界音频的独特能力,同时在宽 SDR 范围和伪影类型下达到前所未有的性能水平。结论:一维 Op-GANs 能够实现鲁棒且计算高效的真实世界音频复原,性能显著提升。源代码和生成的真实世界音频数据集已在专门的 GitHub 仓库中向公众研究界公开。
引用
@article{arxiv.2212.14618,
title = {Blind Restoration of Real-World Audio by 1D Operational GANs},
author = {Turker Ince and Serkan Kiranyaz and Ozer Can Devecioglu and Muhammad Salman Khan and Muhammad Chowdhury and Moncef Gabbouj},
journal= {arXiv preprint arXiv:2212.14618},
year = {2023}
}