中文

SoundBrush:将声音用作视觉场景编辑的画笔

计算机视觉与模式识别 2025-01-03 v1 机器学习 声音 音频与语音处理

摘要

我们提出SoundBrush模型,利用声音作为画笔来编辑和操作视觉场景。我们将潜在扩散模型(LDM)的生成能力扩展到包含音频信息以编辑视觉场景。鼓舞于现有图像编辑工作,我们将此任务定义为监督学习问题,并利用多种现成模型构建声音配对视觉场景数据集进行训练。该丰富的数据集使SoundBrush能够学习将音频特征映射到LDM的文本空间,从而实现由多样化真实声音驱动的视觉场景编辑。与现有方法不同,SoundBrush能够准确地操控整个场景,甚至插入发声对象以最佳匹配音频输入,同时保留原始内容。此外,通过与新颖视图合成技术的集成,我们的框架可扩展到编辑3D场景,实现声音驱动的3D场景操控。演示可在https://soundbrush.github.io/查看。

关键词

引用

@article{arxiv.2501.00645,
  title  = {SoundBrush: Sound as a Brush for Visual Scene Editing},
  author = {Kim Sung-Bin and Kim Jun-Seong and Junseok Ko and Yewon Kim and Tae-Hyun Oh},
  journal= {arXiv preprint arXiv:2501.00645},
  year   = {2025}
}

备注

AAAI 2025