中文

ContextFlow: 通过自适应上下文丰富实现无训练视频对象编辑

计算机视觉与模式识别 2025-11-26 v2

摘要

训练-free 视频对象编辑旨在实现精确的对象级操作,包括对象插入、交换和删除。然而,它面临着在保持保真度和时序一致性方面的重大挑战。现有方法通常针对 U-Net 架构设计,受限于两个主要限制:由于一阶求解器导致的精确 inversion,以及由于粗糙的“硬”特征替换造成的上下文冲突。这些问题在 Diffusion Transformer (DiT) 中更具挑战性,因为先前的层选择启发式方法不适用于 DiT,使得有效指导变得困难。为解决这些限制,我们引入 ContextFlow,一种新的无训练框架,用于 DiT-based 视频对象编辑。具体而言,我们首先采用高阶 Rectified Flow 求解器建立稳健的编辑基础。Our 框架的核心是自适应上下文丰富 (Adaptive Context Enrichment,指定要编辑的内容),一种解决上下文冲突的机制。与替换特征不同,它通过连接平行重建和编辑路径的 Key-Value 对来丰富自注意力上下文,从而使模型能够动态融合信息。此外,为了确定在何处应用此丰富 (指定在何处编辑),我们提出了一种系统的方法,基于数据驱动的分析来识别特定于任务的关键层。基于我们新近提出的 Guidance Responsiveness Metric,我们的方法确定不同任务 (例如插入、交换) 最有影响力的 DiT 块,从而实现有针对性且高度有效的指导。广泛的实验表明,ContextFlow 在显著优于现有训练-free 方法的同时,甚至超过了几个最先进的训练-based 方法,交付了时序连贯、保真度高的结果。

关键词

引用

@article{arxiv.2509.17818,
  title  = {ContextFlow: Training-Free Video Object Editing via Adaptive Context Enrichment},
  author = {Yiyang Chen and Xuanhua He and Xiujun Ma and Yue Ma},
  journal= {arXiv preprint arXiv:2509.17818},
  year   = {2025}
}

备注

The project page is at https://yychen233.github.io/ContextFlow-page