中文

MambaFoley:使用选择性状态空间模型生成拟音

音频与语音处理 2025-03-14 v2 声音

摘要

深度学习的最新进展导致音频内容生成技术的广泛使用,特别是在各种任务中采用去噪扩散概率模型(DDPM)。其中,拟音合成因其在多媒体内容创作应用中的作用而备受关注。鉴于声音的时间依赖性,设计能够有效处理音频样本序列建模的生成模型至关重要。选择性状态空间模型(SSM)最近被提出作为先前技术的一种有效替代方案,在较低的计算复杂度下展示了具有竞争力的性能。在本文中,我们介绍了MambaFoley,这是一个基于扩散的模型,据我们所知,它是第一个利用最近提出的SSM(称为Mamba)进行拟音生成任务的模型。为了评估所提出方法的有效性,我们通过客观和主观分析将其与最先进的拟音生成模型进行了比较。

关键词

引用

@article{arxiv.2409.09162,
  title  = {MambaFoley: Foley Sound Generation using Selective State-Space Models},
  author = {Marco Furio Colombo and Francesca Ronchini and Luca Comanducci and Fabio Antonacci},
  journal= {arXiv preprint arXiv:2409.09162},
  year   = {2025}
}

备注

Accepted at ICASSP 2025