中文

基于视觉引导的多样化类别高质量声音分离

计算机视觉与模式识别 2024-10-14 v2 声音 音频与语音处理

摘要

我们提出 DAVIS,一种基于扩散的视听分离框架,通过生成式学习解决视听声源分离任务。现有方法通常将声音分离视为基于掩码的回归问题,取得了显著进展。然而,它们在捕捉复杂数据分布以实现多样化类别声音的高质量分离方面存在局限。相比之下,DAVIS 利用生成式扩散模型和分离 U-Net,以音频混合与视觉信息为条件,直接从高斯噪声合成分离出的声音。凭借其生成式目标,DAVIS 更适于实现跨多样化声音类别的高质量声音分离。我们在 AVE 和 MUSIC 数据集上将 DAVIS 与现有最先进的判别式视听分离方法进行比较,结果表明 DAVIS 在分离质量上优于其他方法,展示了我们的框架在处理视听源分离任务上的优势。

关键词

引用

@article{arxiv.2308.00122,
  title  = {High-Quality Visually-Guided Sound Separation from Diverse Categories},
  author = {Chao Huang and Susan Liang and Yapeng Tian and Anurag Kumar and Chenliang Xu},
  journal= {arXiv preprint arXiv:2308.00122},
  year   = {2024}
}

备注

ACCV 2024 Oral