中文

利用生成对抗网络随机复原重度压缩的音乐音频

声音 2022-07-06 v1 音频与语音处理

摘要

有损音频编解码器通过去除人类感知中往往听不见的信息来压缩(及解压缩)数字音频流。在高压缩率下,此类编解码器可能在音频信号中引入多种损伤。许多工作已使用深度学习技术处理音频增强与压缩伪影去除问题。然而,仅有少数工作处理音乐领域中重度压缩音频信号的复原。在此情形下,原始信号的复原不存在唯一解。因此,在本研究中,我们测试了生成对抗网络(GAN)架构的随机生成器用于该任务。这样的随机生成器以高度压缩的音乐音频信号为条件,有朝一日可生成与高质量发行版无法区分的输出。因此,本研究或可启发更高效的音乐数据存储与传输。我们在 16、32 与 64 kbit/s 的 MP3 压缩音频信号上训练随机与确定性生成器。我们利用客观指标与听音测试对不同实验进行了广泛评估。我们发现,对于 16 与 32 kbit/s,模型能较 MP3 版本提升音频信号质量,且随机生成器能够生成比确定性生成器更接近于原始信号的输出。

关键词

引用

@article{arxiv.2207.01667,
  title  = {Stochastic Restoration of Heavily Compressed Musical Audio using Generative Adversarial Networks},
  author = {Stefan Lattner and Javier Nistal},
  journal= {arXiv preprint arXiv:2207.01667},
  year   = {2022}
}

备注

21 pages, 5 figures, published in MDPI Electronics Special Issue "Machine Learning Applied to Music/Audio Signal Processing"