流式拖拽导向的交互式视频操控:随时拖拽任何物体!
计算机视觉与模式识别
2026-05-29 v4
摘要
实现对自回归视频扩散模型输出的流式、细粒度控制仍然具有挑战性,难以确保它们始终与用户期望保持一致。为了弥合这一差距,我们提出了**流式拖拽导向的交互式视频操控**,这是一项新任务,允许用户通过细粒度的交互式拖拽*随时*对*任何事物*修改生成的视频。超越 DragVideo 和 SG-I2V,REVEL 将拖拽式视频操控统一为对视频帧的编辑和动画化,同时支持用户指定的平移、变形和旋转效果,使拖拽操作更加通用。在解决 REVEL 时,我们观察到:*i*) 拖拽引起的扰动在隐空间中累积,导致严重的隐变量分布漂移,从而中止拖拽过程;*ii*) 流式拖拽很容易受到上下文帧的干扰,从而产生视觉上不自然的结果。因此,我们提出了一种免训练方法,**DragStream**,包含:*i*) 一种自适应分布自校正策略,利用相邻帧的统计量来有效约束隐变量嵌入的漂移;*ii*) 一种空间-频率选择性优化机制,允许模型充分利用上下文信息,同时通过在生成过程中选择性传播视觉线索来减轻其干扰。我们的方法可以无缝集成到现有的自回归视频扩散模型中,大量实验充分证明了 DragStream 的有效性。
引用
@article{arxiv.2510.03550,
title = {Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!},
author = {Junbao Zhou and Yuan Zhou and Kesen Zhao and Qingshan Xu and Beier Zhu and Richang Hong and Hanwang Zhang},
journal= {arXiv preprint arXiv:2510.03550},
year = {2026}
}