AEROMamba:基于生成对抗网络与状态空间模型的高效音频超分辨率架构
音频与语音处理
2024-11-13 v1 声音
摘要
音频超分辨率旨在通过生成高频内容来增强低分辨率信号。在本工作中,我们修改了 AERO(该任务的最先进系统)的架构,用于音乐超分辨率。具体而言,我们在所有网络层中用 Mamba(一种状态空间模型 SSM)替换了其原始的 Attention 与 LSTM 层。Mamba 能有效替代上述模块,因为它提供了类似 Attention 的机制,同时也作为循环网络发挥作用。采用所提 AEROMamba 后,训练所需 GPU 显存减少 2-4 倍,因为 Mamba 利用卷积公式并发挥 GPU 显存层级优势。此外,在推理阶段,Mamba 因循环特性以常数显存运行,避免了 Attention 伴随的显存增长。这带来了 14 倍的速度提升,且 GPU 使用量减少 5 倍。主观听感测试(0-100 分制)显示,所提模型超越 AERO 模型。在 MUSDB 数据集上,退化信号得分 38.22,AERO 与 AEROMamba 分别得 60.03 与 66.74;在 PianoEval 数据集上,退化信号得分 72.92,AERO 与 AEROMamba 分别得 76.89 与 84.41。
引用
@article{arxiv.2411.07364,
title = {AEROMamba: An efficient architecture for audio super-resolution using generative adversarial networks and state space models},
author = {Wallace Abreu and Luiz Wagner Pereira Biscainho},
journal= {arXiv preprint arXiv:2411.07364},
year = {2024}
}
备注
Accepted at LAMIR 2024 Workshop (ISMIR 2024 Satellite Event)