中文

深度音频波形先验

声音 2022-10-26 v1 机器学习 音频与语音处理

摘要

卷积神经网络包含用于生成自然外观图像的强先验[1]。这些先验能够以无监督方式实现图像去噪、超分辨率与修复。先前在音频中展示类似思想(即深度音频先验)的尝试:(i) 使用如谐波卷积等手工挑选的架构,(ii) 仅适用于谱图输入,且 (iii) 主要用于消除高斯噪声[2]。在本工作中,我们表明现有的用于音频源分离的 SOTA 架构即使在处理原始波形时也包含深度先验。深度先验可通过训练神经网络以白噪声为输入来生成单一受损信号而被发现。具有相关深度先验的网络可能在收敛到受损信号之前生成更干净的信号版本。我们以若干种损伤展示了该复原效果:背景噪声、混响以及信号中的缺口(音频修复)。

关键词

引用

@article{arxiv.2207.10441,
  title  = {Deep Audio Waveform Prior},
  author = {Arnon Turetzky and Tzvi Michelson and Yossi Adi and Shmuel Peleg},
  journal= {arXiv preprint arXiv:2207.10441},
  year   = {2022}
}

备注

Interspeech 2022