用于音频去噪的复数图像生成扩散Transformer
声音
2024-06-14 v1 音频与语音处理
摘要
音频去噪技术在深度神经网络领域引起了广泛关注。近年来,音频去噪问题已被转化为图像生成任务,并应用基于深度学习的方法来解决该问题。然而,其性能仍然有限,留有进一步改进的空间。为了提升音频去噪性能,本文引入了一种复数图像生成扩散Transformer,它从复数傅里叶域捕获更多信息。我们通过将Transformer与扩散模型集成,探索了一种新颖的扩散Transformer。我们提出的模型展示了Transformer的可扩展性,并利用注意力扩散扩展了稀疏注意力的感受野。我们的工作是首批利用扩散Transformer处理音频去噪图像生成任务的研究之一。在两个基准数据集上进行的大量实验表明,我们提出的模型优于最先进的方法。
引用
@article{arxiv.2406.09161,
title = {Complex Image-Generative Diffusion Transformer for Audio Denoising},
author = {Junhui Li and Pu Wang and Jialu Li and Youshan Zhang},
journal= {arXiv preprint arXiv:2406.09161},
year = {2024}
}
备注
INTERSPEECH 2024