中文

基于遮挡感知的物理-语义关键帧选择,用于稳健视频编辑

计算机视觉与模式识别 2026-05-28 v2

摘要

视频编辑近期在基于扩散的生成模型中取得了显著进展,使其能够从自然语言指令中实现多样化的对象级操作。然而,现有方法在遮挡、视点变化和快速物体运动时常常难以应对,这些情况下视觉观察不可靠,会导致定位不准、时间上的闪烁以及编辑不一致。在本工作中,我们识别到可靠视觉锚点缺失是遮挡鲁棒视频编辑的根本性瓶颈。为解决此问题,我们提出了一种遮挡感知的物理-语义关键帧选择框架,用于自动识别下游编辑的最优锚帧。具体而言,我们的方法从三个互补的角度评估候选帧:结构完整性用于避免被截断的观察、循环一致的跟踪稳定性用于衡量物理可靠性,以及基于视觉-语言的属性可见性用于确保语义清晰。选定的关键帧随后通过双向跟踪传播,以生成稠密的时空掩码,这些掩码用作基于扩散的视频编辑主干网络的辅助监督。通过将遮挡处理从显式重建转化为可靠的锚点选择,我们的框架能够在无需手动标注的情况下实现精确且时序一致的编辑。大量实验在具有挑战性的视频编辑基准数据集上表明,我们的方法在有效性和高质量性能方面均显示出色。

关键词

引用

@article{arxiv.2605.23192,
  title  = {Occlusion-Aware Physics-Semantic Keyframe Selection for Robust Video Editing},
  author = {Lin Liu and Zhihan Xiao and Haohang Xu and Rong Cong and Zhibo Zhang and Xiaopeng Zhang and Qi Tian},
  journal= {arXiv preprint arXiv:2605.23192},
  year   = {2026}
}