中文

基于多视图先验的可控视频物体插入

计算机视觉与模式识别 2026-04-17 v1 人工智能

摘要

视频物体插入是动态将新对象插入现有环境中的关键任务。以往的视频生成方法主要关注合成整个场景,在插入物体到现有视频时难以确保一致的外观、空间对齐和时间连贯性。本文提出了一种 novel 的视频物体插入解决方案,通过集成多视图物体先验来解决动态环境中外观不一致和遮挡处理的常见挑战。通过将 2D 参考图像提升为多视图表示,并利用双路径 view-consistent conditioning 机制,我们的框架确保了稳定的身份指导和跨不同视角的鲁健集成。还采用了质量感加权机制来适应处理噪声或不完美的输入。此外,我们引入了集成感知一致性模块,以保证空间真实性,有效解决遮挡和边界伪影,同时在帧之间保持时间连续性。实验结果表明,我们的解决方案显著提高了视频物体插入的质量,提供了稳定且真实的集成效果。

关键词

引用

@article{arxiv.2604.14556,
  title  = {Controllable Video Object Insertion via Multiview Priors},
  author = {Xia Qi and Peishan Cong and Yichen Yao and Ziyi Wang and Yaoqin Ye and Yuexin Ma},
  journal= {arXiv preprint arXiv:2604.14556},
  year   = {2026}
}