中文

VOID: 视频对象与交互删除

计算机视觉与模式识别 2026-04-03 v1 人工智能

摘要

现有的视频对象删除方法擅长补全对象"后面"的内容并修正外观层面的伪影,如阴影和反射。然而,当被删除的对象具有更显著的交互(如与其他对象的碰撞)时,现有模型无法修正这些交互并产生不可信的结果。我们提出了 VOID,一个旨在在这些复杂场景中执行物理合理补全的视频对象删除框架。为了训练模型,我们使用 Kubric 和 HUMOTO 生成了一组新的配对数据集,其中删除对象需要改变下游物理交互。在推理过程中,视觉语言模型识别场景中受删除对象影响的区域。这些区域随后用于引导视频扩散模型生成物理一致的反事实结果。在合成数据和真实数据上的实验表明,我们的方法在对象删除后更好地保持了场景动态的一致性,优于先前的视频对象删除方法。我们希望该框架为如何通过高层因果推理使视频编辑模型成为更好的世界模拟器提供启示。

关键词

引用

@article{arxiv.2604.02296,
  title  = {VOID: Video Object and Interaction Deletion},
  author = {Saman Motamed and William Harvey and Benjamin Klein and Luc Van Gool and Zhuoning Yuan and Ta-Ying Cheng},
  journal= {arXiv preprint arXiv:2604.02296},
  year   = {2026}
}