中文

一致且相关:重新思考通用声音分离中的查询嵌入

音频与语音处理 2023-12-27 v1 声音

摘要

基于查询的音频分离通常采用特定查询从混合音频信号中提取目标声源。目前,大多数基于查询的分离模型需要额外的网络来获取查询嵌入。通过这种方式,分离模型被优化以适应查询嵌入的分布。然而,由于结构不一致和信息独立,查询嵌入可能与分离模型表现出不匹配。在本文中,我们提出了 CaRE-SEP,一种用于通用声音分离的一致且相关的嵌入网络,旨在鼓励对音频分离中查询使用的全面重新思考。CaRE-SEP 从两个方面缓解了查询与分离之间的潜在不匹配,包括共享网络结构和共享特征信息。首先,采用具有共享编码器的 Swin-Unet 模型,将查询编码和声音分离统一到一个模型中,消除了网络架构差异,生成了查询和分离特征的一致分布。其次,通过使用预训练的分类网络初始化 CaRE-SEP 并允许梯度反向传播,优化查询嵌入使其与分离特征相关,进一步缓解了特征不匹配问题。实验结果表明,所提出的 CaRE-SEP 模型显著提高了分离任务的性能。此外,可视化验证了潜在的不匹配以及 CaRE-SEP 如何解决这一问题。

关键词

引用

@article{arxiv.2312.15463,
  title  = {Consistent and Relevant: Rethink the Query Embedding in General Sound Separation},
  author = {Yuanyuan Wang and Hangting Chen and Dongchao Yang and Jianwei Yu and Chao Weng and Zhiyong Wu and Helen Meng},
  journal= {arXiv preprint arXiv:2312.15463},
  year   = {2023}
}

备注

Accepted by ICASSP 2024