中文

用于音频去噪的复数图像生成扩散Transformer

声音 2024-06-14 v1 音频与语音处理

摘要

音频去噪技术在深度神经网络领域引起了广泛关注。近年来,音频去噪问题已被转化为图像生成任务,并应用基于深度学习的方法来解决该问题。然而,其性能仍然有限,留有进一步改进的空间。为了提升音频去噪性能,本文引入了一种复数图像生成扩散Transformer,它从复数傅里叶域捕获更多信息。我们通过将Transformer与扩散模型集成,探索了一种新颖的扩散Transformer。我们提出的模型展示了Transformer的可扩展性,并利用注意力扩散扩展了稀疏注意力的感受野。我们的工作是首批利用扩散Transformer处理音频去噪图像生成任务的研究之一。在两个基准数据集上进行的大量实验表明,我们提出的模型优于最先进的方法。

关键词

引用

@article{arxiv.2406.09161,
  title  = {Complex Image-Generative Diffusion Transformer for Audio Denoising},
  author = {Junhui Li and Pu Wang and Jialu Li and Youshan Zhang},
  journal= {arXiv preprint arXiv:2406.09161},
  year   = {2024}
}

备注

INTERSPEECH 2024