中文

PromptSep:基于多模态提示的生成式音频分离

声音 2025-11-07 v1 音频与语音处理

摘要

近期语言查询音频源分离(LASS)的突破表明,生成式模型能够实现高于传统掩码方法的更高分离音频质量。然而,两个关键限制阻碍了其实际应用:(1)用户通常需要执行除分离之外的操作,如声音移除;(2)仅依赖文本提示用于指定声源往往不够直观。本文提出了 PromptSep,以扩展 LASS 为更通用的声音分离框架。PromptSep 利用增强数据模拟的条件扩散模型,实现音频提取和声音移除。为超越文本唯一查询,本文将声乐模仿作为额外且更直观的条件模态纳入模型,通过将 Sketch2Sound 作为数据增强策略实现。在多个基准上的客观和主观评估表明,PromptSep 在声音移除和声乐模仿引导的源分离方面实现了最新性能,同时在语言查询源分离方面保持竞争性成绩。

关键词

引用

@article{arxiv.2511.04623,
  title  = {PromptSep: Generative Audio Separation via Multimodal Prompting},
  author = {Yutong Wen and Ke Chen and Prem Seetharaman and Oriol Nieto and Jiaqi Su and Rithesh Kumar and Minje Kim and Paris Smaragdis and Zeyu Jin and Justin Salamon},
  journal= {arXiv preprint arXiv:2511.04623},
  year   = {2025}
}

备注

Submitted to ICASSP 2026