HybridSep:基于预训练模型融合与对抗扩散训练的语言查询音频源分离
声音
2025-06-23 v1 音频与语音处理
摘要
语言查询音频分离(LASS)运用语言查询来基于语义描述隔离目标声音。然而,现有方法在对齐复杂听觉特征与语言语境的同时保持分离精度方面面临挑战。当前研究主要关注文本描述数据增强和架构创新,却未充分探索将预训练自监督学习(SSL)音频模型与对比语言-音频预训练(CLAP)框架集成,后者能够提取跨模态音频-文本关系。为此,我们提出了 HybridSep,一个两阶段 LASS 框架,将 SSL 基于声学的表征与 CLAP 派生的语义嵌入融合。我们的框架引入了对抗一致训练(ACT),一种新的优化策略将扩散作为辅助正则化损失集成,并通过对抗训练来增强分离保真度。实验表明,HybridSep 在多个指标上显著优于 AudioSep、FlowSep 等最新基线,为 LASS 任务树立了新标杆。
引用
@article{arxiv.2506.16833,
title = {Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training},
author = {Jianyuan Feng and Guangzheng Li and Yangfei Xu},
journal= {arXiv preprint arXiv:2506.16833},
year = {2025}
}
备注
Submitted to WASAA 2025