中文

用于视觉鸟鸣去噪的Vision Transformer分割

声音 2024-06-14 v1 音频与语音处理

摘要

音频去噪,特别是在鸟鸣声的背景下,由于持续的残留噪声,仍然是一项具有挑战性的任务。传统和深度学习方法常常难以处理人工或低频噪声。在这项工作中,我们提出了ViTVS,一种利用Vision Transformer(ViT)架构能力的新颖方法。ViTVS巧妙地结合了分割技术,将干净音频从复杂的信号混合物中分离出来。我们的主要贡献包括开发了ViTVS,引入了全面的、长程的和多尺度的表示。这些贡献直接解决了传统方法固有的局限性。大量实验表明,ViTVS优于最先进的方法,使其成为现实世界鸟鸣去噪应用的基准解决方案。源代码可在以下网址获取:https://github.com/aiai-4/ViVTS。

关键词

引用

@article{arxiv.2406.09167,
  title  = {Vision Transformer Segmentation for Visual Bird Sound Denoising},
  author = {Sahil Kumar and Jialu Li and Youshan Zhang},
  journal= {arXiv preprint arXiv:2406.09167},
  year   = {2024}
}

备注

INTERSPEECH 2024