Soundini:用于自然视频编辑的声音引导扩散方法
计算机视觉与模式识别
2023-04-17 v1
摘要
我们提出了一种在零样本设定下为视频特定区域添加声音引导视觉特效的方法。对视觉特效的外观进行动画处理具有挑战性,因为编辑视频的每一帧都应在保持时间一致性的同时发生视觉变化。此外,现有视频编辑方案侧重于帧间的时间一致性,忽略了随时间变化的视觉风格,例如雷暴、波浪、火焰噼啪声。为克服该局限,我们利用时间声音特征来实现动态风格。具体而言,我们在视听潜空间中以音频潜表示引导去噪扩散概率模型。据我们所知,我们的工作是首个探索具有强度、音色与音量等声音专门属性的多源声音引导自然视频编辑。此外,我们设计了基于光流的引导以生成时间一致的视频帧,捕捉相邻帧间的像素级关系。实验结果表明,我们的方法优于现有视频编辑技术,生成了更能反映声音属性的逼真视觉特效。请访问我们的页面:https://kuai-lab.github.io/soundini-gallery/。
引用
@article{arxiv.2304.06818,
title = {Soundini: Sound-Guided Diffusion for Natural Video Editing},
author = {Seung Hyun Lee and Sieun Kim and Innfarn Yoo and Feng Yang and Donghyeon Cho and Youngseo Kim and Huiwen Chang and Jinkyu Kim and Sangpil Kim},
journal= {arXiv preprint arXiv:2304.06818},
year = {2023}
}