中文

Smart-Insertion-V:基于闭环反馈双流框架的无掩码视频物体插入

计算机视觉与模式识别 2026-05-25 v1

摘要

无掩码视频物体插入已成为一项具有挑战性的任务,要求将参考物体和谐地集成到源视频中。然而,现有方法在参考物体与源场景存在显著风格域差异时难以实现理想效果。为克服此困难,我们提出了 \textit{\textbf{Smart-Insertion-V}},一个端到端的 \textbf{双流框架},同时进行视频插入和图像风格迁移。在此框架中,图像流同步引导视频生成过程,同时引入 \textbf{闭环反馈机制} 以确保插入的稳健性。不可避免地,将这些多样化的条件信号整合会导致特征交织和风格泄漏。为解决此问题,我们设计了 \textbf{Dual-World-View RoPE} 通过时空偏移区分不同信号,同时不增加额外训练开销。此外,为促进空间定位和风格适应,我们引入了 \textbf{解耦引导模块},利用视觉语言模型进行语义推理,同时保留原有的文本编码器时序引导。为弥合和谐参考插入任务的数据差距,我们提出了一个数据 curated pipeline,并将发布一个 \textbf{开源数据集}。实验表明,我们的方法能够将物体插入合理位置,实现最具和谐性的结果。

关键词

引用

@article{arxiv.2605.23891,
  title  = {Smart-Insertion-V: Photorealistic Video Insertion via a Closed-Loop Feedback Dual-Stream Framework},
  author = {Xiao Cao and Yansong Qu and Xiangzhen and Chang and Wen Xiao and Jiakui Hu and Heyuan Li and Jialun Liu and Zhiyong Huang and Xuelong Li},
  journal= {arXiv preprint arXiv:2605.23891},
  year   = {2026}
}