中文

OmniSep:基于查询混合的统一全模态声音分离

声音 2024-10-29 v1 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

近年来,规模扩展在视觉和语言领域取得了巨大成功。然而,在音频领域,研究人员在扩展训练数据时遇到了一个主要挑战,因为大多数自然音频都包含多种干扰信号。为了解决这一局限性,我们引入了全模态声音分离(OmniSep),这是一个新颖的框架,能够基于全模态查询(包括单模态和多模态组合查询)分离出干净的音轨。具体来说,我们引入了 Query-Mixup 策略,该策略在训练期间混合来自不同模态的查询特征。这使得 OmniSep 能够同时优化多种模态,有效地将所有模态统一在一个声音分离框架下。我们通过允许查询对声音分离产生正向或负向影响来进一步增强这种灵活性,从而便于根据需要保留或移除特定声音。最后,OmniSep 采用了一种称为 Query-Aug 的检索增强方法,实现了开放词汇的声音分离。在 MUSIC、VGGSOUND-CLEAN+ 和 MUSIC-CLEAN+ 数据集上的实验评估证明了 OmniSep 的有效性,在文本、图像和音频查询的声音分离任务中均达到了最先进的性能。有关样本和更多信息,请访问演示页面:\url{https://omnisep.github.io/}。

关键词

引用

@article{arxiv.2410.21269,
  title  = {OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup},
  author = {Xize Cheng and Siqi Zheng and Zehan Wang and Minghui Fang and Ziang Zhang and Rongjie Huang and Ziyang Ma and Shengpeng Ji and Jialong Zuo and Tao Jin and Zhou Zhao},
  journal= {arXiv preprint arXiv:2410.21269},
  year   = {2024}
}

备注

Working in progress