MMAudioSep:面向视频/文本查询声音分离的视频到音频生成模型驯化
声音
2026-04-20 v2 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
我们提出 MMAudioSep,一个面向视频/文本查询声音分离的生成模型,其基础是预训练的视频到音频模型。通过利用预训练音频生成模型所学的视频/文本与音频之间关系的知识,我们可以更高效地训练模型,即模型无需从头训练。我们通过与现有分离模型(包括基于确定性方法和基于生成方法的模型)的比较来评估 MMAudioSep 的性能,发现其优于基线模型。此外,我们证明即使在通过微调获得声音分离功能后,模型仍保留了原始视频到音频生成的能力。这凸显了基础声音生成模型被用于声音相关下游任务的潜力。我们的代码可在以下网址获取:https://github.com/sony/mmaudiosep
引用
@article{arxiv.2510.09065,
title = {MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation},
author = {Akira Takahashi and Shusuke Takahashi and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2510.09065},
year = {2026}
}
备注
Accepted to ICASSP 2026. 4 pages, 4 figures, 2 tables