SoundBrush:将声音用作视觉场景编辑的画笔
计算机视觉与模式识别
2025-01-03 v1 机器学习
声音
音频与语音处理
摘要
我们提出SoundBrush模型,利用声音作为画笔来编辑和操作视觉场景。我们将潜在扩散模型(LDM)的生成能力扩展到包含音频信息以编辑视觉场景。鼓舞于现有图像编辑工作,我们将此任务定义为监督学习问题,并利用多种现成模型构建声音配对视觉场景数据集进行训练。该丰富的数据集使SoundBrush能够学习将音频特征映射到LDM的文本空间,从而实现由多样化真实声音驱动的视觉场景编辑。与现有方法不同,SoundBrush能够准确地操控整个场景,甚至插入发声对象以最佳匹配音频输入,同时保留原始内容。此外,通过与新颖视图合成技术的集成,我们的框架可扩展到编辑3D场景,实现声音驱动的3D场景操控。演示可在https://soundbrush.github.io/查看。
引用
@article{arxiv.2501.00645,
title = {SoundBrush: Sound as a Brush for Visual Scene Editing},
author = {Kim Sung-Bin and Kim Jun-Seong and Junseok Ko and Yewon Kim and Tae-Hyun Oh},
journal= {arXiv preprint arXiv:2501.00645},
year = {2025}
}
备注
AAAI 2025