中文

VideoCoF:基于时序推理的统一视频编辑方法

计算机视觉与模式识别 2026-04-07 v2

摘要

现有视频编辑方法面临一个关键权衡:专家模型虽然提供精准功能,但依赖特定于任务的先验(如掩码),从而阻碍统一化;而统一的时序基于上下文学习模型则无需掩码,但缺乏明确的空间线索,导致指令到区域映射不精确和定位不准。为解决这一冲突,我们提出了 VideoCoF,一种受链式思维推理启发的帧链方法。VideoCoF 通过迫使视频扩散模型在生成目标视频标记之前首先预测推理标记(编辑区域潜在表示),来实施“观察、推理、再编辑”程序。这种显式推理步骤消除了对用户提供掩码的需求,同时实现了精确的指令到区域对齐和精细的视频编辑。此外,我们引入了 RoPE 对齐策略,利用这些推理标记确保运动对齐,并支持超出训练时长的长度外推。我们展示,仅需 5 万对视频数据,VideoCoF 即可在 VideoCoF-Bench 上实现最先进的性能,验证了该方法的高效与有效。我们的代码、模型权重和数据均可在 https://github.com/knightyxp/VideoCoF 获取。

关键词

引用

@article{arxiv.2512.07469,
  title  = {VideoCoF: Unified Video Editing with Temporal Reasoner},
  author = {Xiangpeng Yang and Ji Xie and Yiyuan Yang and Yue Ma and Yan Huang and Min Xu and Qiang Wu},
  journal= {arXiv preprint arXiv:2512.07469},
  year   = {2026}
}

备注

Accepted by CVPR 2026, Project Page: https://videocof.github.io/