通过视觉引导生成建模实现跨类别的优质声音分离
计算机视觉与模式识别
2025-09-29 v1 声音
摘要
我们提出了 DAVIS,一个基于扩散的音视频分离框架,通过生成学习解决音视频声音源分离任务。现有方法通常将声音分离框定为基于掩码的回归问题,已取得显著进展。然而,它们在捕捉高质量分离多样化类别声音所需的复杂数据分布方面存在局限。相比之下,DAVIS 通过利用强大的生成建模范式——具体而言是去噪扩散概率模型(DDPM)和近期的流匹配(Flow Matching)——并将其集成在专门的分离 U-Net 架构中,规避了这些问题。我们的框架通过从噪声分布直接合成所需的分离声音频谱图来运作,同时以混合音频输入和相关视觉信息为条件。其生成目标的固有特性使 DAVIS 特别擅长为多样化声音类别生成高质量声音分离。我们对 DAVIS 的两种变体(DDPM 和流匹配)进行了与领先方法在标准 AVE 和 MUSIC 数据集上的对比评估。结果证实两种变体均超越了现有方法在分离质量方面的表现,突显了我们的生成框架在应对音视频源分离任务中的有效性。
引用
@article{arxiv.2509.22063,
title = {High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling},
author = {Chao Huang and Susan Liang and Yapeng Tian and Anurag Kumar and Chenliang Xu},
journal= {arXiv preprint arXiv:2509.22063},
year = {2025}
}
备注
Accepted to IJCV