PromptSep:基于多模态提示的生成式音频分离
声音
2025-11-07 v1 音频与语音处理
摘要
近期语言查询音频源分离(LASS)的突破表明,生成式模型能够实现高于传统掩码方法的更高分离音频质量。然而,两个关键限制阻碍了其实际应用:(1)用户通常需要执行除分离之外的操作,如声音移除;(2)仅依赖文本提示用于指定声源往往不够直观。本文提出了 PromptSep,以扩展 LASS 为更通用的声音分离框架。PromptSep 利用增强数据模拟的条件扩散模型,实现音频提取和声音移除。为超越文本唯一查询,本文将声乐模仿作为额外且更直观的条件模态纳入模型,通过将 Sketch2Sound 作为数据增强策略实现。在多个基准上的客观和主观评估表明,PromptSep 在声音移除和声乐模仿引导的源分离方面实现了最新性能,同时在语言查询源分离方面保持竞争性成绩。
引用
@article{arxiv.2511.04623,
title = {PromptSep: Generative Audio Separation via Multimodal Prompting},
author = {Yutong Wen and Ke Chen and Prem Seetharaman and Oriol Nieto and Jiaqi Su and Rithesh Kumar and Minje Kim and Paris Smaragdis and Zeyu Jin and Justin Salamon},
journal= {arXiv preprint arXiv:2511.04623},
year = {2025}
}
备注
Submitted to ICASSP 2026