中文

LoVoRA: 文本引导且无掩码的视频对象移除与添加及可学习对象感知定位

计算机视觉与模式识别 2025-12-04 v2

摘要

文本引导的视频编辑,特别是对象移除与添加,仍然是一项具有挑战性的任务,因为需要精确的空间和时间一致性。现有方法通常依赖辅助掩码或参考图像进行编辑指导,这限制了其可扩展性和泛化能力。为解决这些问题,我们提出了 LoVoRA,一种基于对象感知定位机制的无掩码视频对象移除与添加框架。我们的方法利用独特的数据集构建流程,集成了图像到视频转换、基于光流的掩码传播和视频修复,实现了时间一致的编辑。LoVoRA 的核心创新在于其可学习的对象感知定位机制,为对象插入和移除任务均提供了密集的时空监督。通过利用扩散掩码预测器,LoVoRA 实现了端到端的视频编辑,无需在推理过程中外部控制信号。大量实验和人类评估证明了 LoVoRA 的有效性和高质量性能。

关键词

引用

@article{arxiv.2512.02933,
  title  = {LoVoRA: Text-guided and Mask-free Video Object Removal and Addition with Learnable Object-aware Localization},
  author = {Zhihan Xiao and Lin Liu and Yixin Gao and Xiaopeng Zhang and Haoxuan Che and Songping Mai and Qi Tian},
  journal= {arXiv preprint arXiv:2512.02933},
  year   = {2025}
}