深度神经网络与端到端学习用于音频压缩
机器学习
2021-07-14 v2 声音
音频与语音处理
摘要
端到端深度学习的近期成果鼓励了利用统一深度网络模型处理高度结构化数据的探索。为音频信号压缩建立此类模型一直具有挑战性,因为这需要不易通过端到端反向传播训练的离散表示。本文提出一种端到端深度学习方法,将循环神经网络(RNNs)结合于变分自编码器(VAEs)的训练策略中,并对潜空间采用二值表示。我们对离散表示使用伯努利分布的重参数化技巧,以实现平滑反向传播。此外,我们的方法允许编码器与解码器分离,这是压缩任务所必需的。据我们所知,这是首个使用 RNNs 的单音频压缩模型的端到端学习,且我们的模型达到了 20.54 的信失真比(SDR)。
引用
@article{arxiv.2105.11681,
title = {Deep Neural Networks and End-to-End Learning for Audio Compression},
author = {Daniela N. Rim and Inseon Jang and Heeyoul Choi},
journal= {arXiv preprint arXiv:2105.11681},
year = {2021}
}