中文

CLAPSep:利用对比预训练模型进行多模态查询条件的目标声音提取

音频与语音处理 2025-03-24 v5

摘要

通用声音分离 (USS) 旨在从真实世界录音中提取任意类型的声音。这可以通过语言查询的目标声音提取 (TSE) 来实现,该方法通常包含两个组件:将用户查询转换为条件嵌入的查询网络,以及相应提取目标声音的分离网络。现有方法通常从头开始训练模型。因此,需要大量的数据和计算资源才能使随机初始化的模型理解声音事件并执行相应的分离。在本文中,我们提出将预训练模型集成到 TSE 模型中以解决上述问题。具体而言,我们定制并适配了强大的对比语言 - 音频预训练模型 (CLAP) 用于 USS,记为 CLAPSep。CLAPSep 还接受灵活的用户输入,利用单模态和/或多模态的正负用户提示进行目标声音提取。CLAPSep 的这些关键特性不仅能增强提取性能,还能提高其应用的通用性。我们在 5 个不同的数据集上进行了广泛的实验,证明了所提出的 CLAPSep 具有优越的性能以及零样本和少样本泛化能力,且训练收敛速度快,显著优于以往的方法。完整的代码和一些音频示例已发布以供复现和评估。

关键词

引用

@article{arxiv.2402.17455,
  title  = {CLAPSep: Leveraging Contrastive Pre-trained Model for Multi-Modal Query-Conditioned Target Sound Extraction},
  author = {Hao Ma and Zhiyuan Peng and Xu Li and Mingjie Shao and Xixin Wu and Ju Liu},
  journal= {arXiv preprint arXiv:2402.17455},
  year   = {2025}
}

备注

Published in: IEEE/ACM Transactions on Audio, Speech, and Language Processing ( Volume: 32), DOI: 10.1109/TASLP.2024.3497586