用于音频降噪的复图像生成SwinTransformer网络
声音
2023-10-26 v1 计算机视觉与模式识别
音频与语音处理
摘要
在真实世界应用中实现高性能音频降噪仍是一项具有挑战性的任务。现有的时频方法往往忽略所生成频域图像的质量。本文将音频降噪问题转化为图像生成任务。我们首先开发了复图像生成SwinTransformer网络,以从复傅里叶域捕获更多信息。随后我们施加结构相似性与细节损失函数以生成高质量图像,并设计SDR损失来最小化降噪音频与干净音频之间的差异。在两个基准数据集上的大量实验表明,我们提出的模型优于最先进的方法。
引用
@article{arxiv.2310.16109,
title = {Complex Image Generation SwinTransformer Network for Audio Denoising},
author = {Youshan Zhang and Jialu Li},
journal= {arXiv preprint arXiv:2310.16109},
year = {2023}
}