利用生成对抗网络随机复原重度压缩的音乐音频
声音
2022-07-06 v1 音频与语音处理
摘要
有损音频编解码器通过去除人类感知中往往听不见的信息来压缩(及解压缩)数字音频流。在高压缩率下,此类编解码器可能在音频信号中引入多种损伤。许多工作已使用深度学习技术处理音频增强与压缩伪影去除问题。然而,仅有少数工作处理音乐领域中重度压缩音频信号的复原。在此情形下,原始信号的复原不存在唯一解。因此,在本研究中,我们测试了生成对抗网络(GAN)架构的随机生成器用于该任务。这样的随机生成器以高度压缩的音乐音频信号为条件,有朝一日可生成与高质量发行版无法区分的输出。因此,本研究或可启发更高效的音乐数据存储与传输。我们在 16、32 与 64 kbit/s 的 MP3 压缩音频信号上训练随机与确定性生成器。我们利用客观指标与听音测试对不同实验进行了广泛评估。我们发现,对于 16 与 32 kbit/s,模型能较 MP3 版本提升音频信号质量,且随机生成器能够生成比确定性生成器更接近于原始信号的输出。
引用
@article{arxiv.2207.01667,
title = {Stochastic Restoration of Heavily Compressed Musical Audio using Generative Adversarial Networks},
author = {Stefan Lattner and Javier Nistal},
journal= {arXiv preprint arXiv:2207.01667},
year = {2022}
}
备注
21 pages, 5 figures, published in MDPI Electronics Special Issue "Machine Learning Applied to Music/Audio Signal Processing"