BirdSoundsDenoising:面向鸟鸣的深度视觉音频去噪
声音
2022-10-20 v1 计算机视觉与模式识别
音频与语音处理
摘要
音频去噪已借助传统方法与基于深度学习的方法被研究数十年。然而,这些方法仍局限于人工添加的人工噪声或较低的去噪音频质量。为克服这些挑战,我们收集了一个大规模自然噪声鸟鸣数据集。我们首次将音频去噪问题转化为图像分割问题,并提出一种深度视觉音频去噪(DVAD)模型。利用共计 14,120 张音频图像,我们开发了音频 ImageMask 工具,并提议使用少样本泛化策略来标注这些图像。大量实验结果证明所提模型达到了最先进的性能。我们还展示了我们的方法可轻松泛化至语音去噪、音频分离、音频增强与噪声估计。
引用
@article{arxiv.2210.10196,
title = {BirdSoundsDenoising: Deep Visual Audio Denoising for Bird Sounds},
author = {Youshan Zhang and Jialu Li},
journal= {arXiv preprint arXiv:2210.10196},
year = {2022}
}
备注
WACV 2023