SpecMaskGIT:用于高效音频合成及更多应用的音频频谱图掩码生成建模
声音
2024-06-27 v2 音频与语音处理
摘要
最近在迭代合成音频片段的生成模型方面的进展为文本到音频合成(TTA)带来了巨大成功,但代价是合成速度慢和计算量大。尽管已有尝试加速迭代过程,但由于推理阶段需要数百次迭代以及大量模型参数,高质量的TTA系统仍然效率低下。为了应对这些挑战,我们提出了SpecMaskGIT,一个基于频谱图掩码生成建模的轻量级、高效且有效的TTA模型。首先,SpecMaskGIT通过少于16次迭代合成一个逼真的10秒音频片段,比之前的迭代TTA方法少一个数量级。作为一个离散模型,SpecMaskGIT在TTA基准测试中优于更大的VQ-Diffusion和自回归模型,同时仅使用4个CPU核心即可实现实时处理,或在GPU上快30倍。其次,基于梅尔频谱图的潜在空间,SpecMaskGIT比基于潜在波形域的类似方法具有更广泛的应用范围(例如,零样本带宽扩展)。此外,我们将SpecMaskGIT解释为先前判别性音频掩码Transformer的生成扩展,并阐明了其音频表示学习潜力。我们希望我们的工作能激发对掩码音频建模在更多样化场景中的探索。
引用
@article{arxiv.2406.17672,
title = {SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond},
author = {Marco Comunità and Zhi Zhong and Akira Takahashi and Shiqi Yang and Mengjie Zhao and Koichi Saito and Yukara Ikemiya and Takashi Shibuya and Shusuke Takahashi and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2406.17672},
year = {2024}
}
备注
6 pages, 8 figures, 8 tables. Audio samples: https://zzaudio.github.io/SpecMaskGIT/index.html