中文

MARS-Sep:多模态对齐的强化声音分离

声音 2026-02-18 v2 人工智能

摘要

通用声音分离面临一个根本性的错位:针对低层信号指标优化的模型通常会产生语义污染的输出,无法有效抑制来自声学相似源的感知上显著的干扰。我们引入了一个偏好对齐视角,类似于将LLM与人类意图对齐。为了解决这个问题,我们提出了MARS-Sep,一个将分离重新表述为决策制定的强化学习框架。MARS-Sep不是简单地回归真实掩码,而是学习一个由偏好奖励模型引导并由稳定的、裁剪的信任区域代理优化的分解Beta掩码策略。该奖励源自一个渐进对齐的音频-文本-视觉编码器,直接激励与查询提示的语义一致性。在多个基准上的大量实验表明,在文本、音频和图像查询的分离中均取得了一致的增益,在信号指标和语义质量方面都有显著改进。我们的代码可在https://github.com/mars-sep/MARS-Sep获取。声音分离样本可在https://mars-sep.github.io/获取。

关键词

引用

@article{arxiv.2510.10509,
  title  = {MARS-Sep: Multimodal-Aligned Reinforced Sound Separation},
  author = {Zihan Zhang and Xize Cheng and Zhennan Jiang and Dongjie Fu and Jingyuan Chen and Zhou Zhao and Tao Jin},
  journal= {arXiv preprint arXiv:2510.10509},
  year   = {2026}
}

备注

ICLR 2026