中文

基于 Audio-Visual Separator 的声景音频-视觉生成与分离

计算机视觉与模式识别 2025-04-28 v1 人工智能 多媒体 声音 音频与语音处理

摘要

近期的音频-视觉生成模型在从音频生成图像方面取得了显著进展。然而,现有方法专注于从单类音频生成图像,无法处理混合音频中的图像生成。为此,我们提出了声景音频-视觉生成与分离模型 (AV-GAS),用于从包含多类的混合音频 (soundscape) 生成图像。我们的贡献有三点:首先,我们提出了音频-视觉生成任务的新挑战,即给定多类音频输入生成图像,并通过音频-视觉分离器实现此任务。其次,我们引入了新的音频-视觉分离任务,即为混合音频中每个类别生成独立图像。最后,我们提出了新的评估指标:类别表示得分 (CRS) 和修改后的 R@K。我们的模型在 VGGSound 数据集上进行训练和评估。我们展示了该方法在生成混合音频相关图像方面优于现有方法,CRS 提高 7%,R@2* 提高 4%。

关键词

引用

@article{arxiv.2504.18283,
  title  = {Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator},
  author = {Minjae Kang and Martim Brandão},
  journal= {arXiv preprint arXiv:2504.18283},
  year   = {2025}
}

备注

Originally submitted to CVPR 2025 on 2024-11-15 with paper ID 15808