MambaFoley:使用选择性状态空间模型生成拟音
音频与语音处理
2025-03-14 v2 声音
摘要
深度学习的最新进展导致音频内容生成技术的广泛使用,特别是在各种任务中采用去噪扩散概率模型(DDPM)。其中,拟音合成因其在多媒体内容创作应用中的作用而备受关注。鉴于声音的时间依赖性,设计能够有效处理音频样本序列建模的生成模型至关重要。选择性状态空间模型(SSM)最近被提出作为先前技术的一种有效替代方案,在较低的计算复杂度下展示了具有竞争力的性能。在本文中,我们介绍了MambaFoley,这是一个基于扩散的模型,据我们所知,它是第一个利用最近提出的SSM(称为Mamba)进行拟音生成任务的模型。为了评估所提出方法的有效性,我们通过客观和主观分析将其与最先进的拟音生成模型进行了比较。
引用
@article{arxiv.2409.09162,
title = {MambaFoley: Foley Sound Generation using Selective State-Space Models},
author = {Marco Furio Colombo and Francesca Ronchini and Luca Comanducci and Fabio Antonacci},
journal= {arXiv preprint arXiv:2409.09162},
year = {2025}
}
备注
Accepted at ICASSP 2025