AudioScenic:面向音频驱动的视频场景编辑
计算机视觉与模式识别
2024-04-26 v1
摘要
音频驱动的视觉场景编辑旨在根据给定的音频信号操控视觉背景,而保持前景内容不变。与当前主要关注图像编辑的工作不同,音频驱动的视频场景编辑鲜有探讨。本文引入 AudioScenic,一个面向视频场景编辑的音频驱动框架。AudioScenic 通过引入时间感知的音频语义注入过程将音频语义整合到视觉场景中。由于我们的关注点在于背景编辑,我们进一步引入了 SceneMasker 模块,以在编辑过程中保持前景内容的完整性。AudioScenic 利用音频的内在特性——音频幅度和频率——来指导编辑过程,以控制场景的时间动态并增强时间一致性。首先,我们提出了音频幅度调制模块,用于响应音频幅度变化调整场景的时间动态,从而增强视觉动态。其次,设计了音频频率融合模块,通过将音频频率与视频场景的动态相容性来确保时间一致性,从而提高编辑后视频的整体时间连贯性。这些集成特征使 AudioScenic 不仅能够提升视觉多样性,还能在整个视频中保持时间一致性。我们提出了一种新的指标——时间分数——用于更全面地验证时间一致性。我们在 DAVIS 和 Audioset 数据集上演示了 AudioScenic 相对于竞争方法的显著进步。
引用
@article{arxiv.2404.16581,
title = {AudioScenic: Audio-Driven Video Scene Editing},
author = {Kaixin Shen and Ruijie Quan and Linchao Zhu and Jun Xiao and Yi Yang},
journal= {arXiv preprint arXiv:2404.16581},
year = {2024}
}