用于视觉鸟鸣去噪的Vision Transformer分割
声音
2024-06-14 v1 音频与语音处理
摘要
音频去噪,特别是在鸟鸣声的背景下,由于持续的残留噪声,仍然是一项具有挑战性的任务。传统和深度学习方法常常难以处理人工或低频噪声。在这项工作中,我们提出了ViTVS,一种利用Vision Transformer(ViT)架构能力的新颖方法。ViTVS巧妙地结合了分割技术,将干净音频从复杂的信号混合物中分离出来。我们的主要贡献包括开发了ViTVS,引入了全面的、长程的和多尺度的表示。这些贡献直接解决了传统方法固有的局限性。大量实验表明,ViTVS优于最先进的方法,使其成为现实世界鸟鸣去噪应用的基准解决方案。源代码可在以下网址获取:https://github.com/aiai-4/ViVTS。
引用
@article{arxiv.2406.09167,
title = {Vision Transformer Segmentation for Visual Bird Sound Denoising},
author = {Sahil Kumar and Jialu Li and Youshan Zhang},
journal= {arXiv preprint arXiv:2406.09167},
year = {2024}
}
备注
INTERSPEECH 2024