声点运动:音频与文本调谐用于视频编辑
图形学
2026-05-18 v1 计算机视觉与模式识别
多媒体
声音
摘要
大型生成式视频模型在运动中心视频编辑方面仍存在困难,这些模型通常对外观变化响应良好,但在现有剪辑中产生特定、局部的动作或状态转换方面难以实现。我们提出了 Sound Sparks Motion,一个通过在测试时对其内部多模态条件信号进行调谐来实现视频编辑中运动编辑的无训练框架。与修改模型权重不同,我们的方法仅调谐两种轻量级变量:一个来自源视频的音频潜在变量以及文本条件中的残差扰动。我们发现,这种组合可以鼓励运动编辑,这些运动是底层模型在仅凭提示控制下往往难以实现的。由于没有直接方法来评估文本与运动之间的时间对齐,我们使用一个视觉-语言模型来提供反馈,指示所需运动是否出现在生成的视频中。这种简单的监督为运动编辑提供了有效的语义目标,同时正则化和感知-时间约束有助于保持内容和视觉质量。除了针对单个视频的调谐,我们展示了所学的潜在控制变量可以在视频之间可移植,表明它们捕获的是可重用的运动编辑方向,而非对单个示例的过拟合。我们的结果突显了通过音频路径进行多模态条件调谐作为运动感知视频编辑的有前景的方向,表明测试时调谐可作为一种轻量级探针机制,揭示模型多模态条件中潜在的运动控制。代码和数据可通过我们的项目页面获取:https://amirhossein-razlighi.github.io/Sound_Sparks_Motion/。
引用
@article{arxiv.2605.15307,
title = {Sound Sparks Motion: Audio and Text Tuning for Video Editing},
author = {AmirHossein Naghi Razlighi and Aryan Mikaeili and Ali Mahdavi-Amiri and Daniel Cohen-Or and Yiorgos Chrysanthou},
journal= {arXiv preprint arXiv:2605.15307},
year = {2026}
}
备注
Project Page: https://amirhossein-razlighi.github.io/Sound_Sparks_Motion