面向视频对象分割的音频生成
计算机视觉与模式识别
2025-10-01 v1
摘要
现有多模态音频生成模型往往缺乏精确的用户控制能力,这限制了其在专业 Foley 工作流程中的应用。具体而言,这些模型关注整段视频,无法为特定场景中的目标对象提供精准的优先级,导致生成不必要的背景音效,或聚焦于错误的目标对象。为此,我们提出了视频对象分割感知的音频生成这一新任务,显式地将声音合成条件化于对象级别的分割图。我们 presented SAGANet,一个新的多模态生成模型,能够通过利用视觉分割掩码、视频与文本线索,实现可控的音频生成。该模型为用户提供了对音频生成的细粒度且视觉局部化的控制。为支持该任务及进一步的分割感知 Foley 研究,我们提出了 Segmented Music Solos 数据集,包含带分割信息的乐器演奏视频。我们的方法在当前 SOTA 方法之上实现了显著的性能提升,树立了可控、高保真 Foley 合成的新标准。代码、样本及 Segmented Music Solos 数据集均已公开(https://saganet.notion.site)。
引用
@article{arxiv.2509.26604,
title = {Video Object Segmentation-Aware Audio Generation},
author = {Ilpo Viertola and Vladimir Iashin and Esa Rahtu},
journal= {arXiv preprint arXiv:2509.26604},
year = {2025}
}
备注
Preprint version. The Version of Record is published in DAGM GCPR 2025 proceedings with Springer Lecture Notes in Computer Science (LNCS). Updated results and resources are available at the project page: https://saganet.notion.site