中文

基于MLLM环境感知推理的视频物体插入——Place-it-R1

计算机视觉与模式识别 2026-03-09 v1 人工智能

摘要

现代视频编辑技术在插入视频物体方面实现了高视觉保真度,但它们关注的是优化视觉保真度而非物理因果性,导致编辑与其环境之间存在物理不一致性。在本工作中,我们提出了 Place-it-R11,一个用于视频物体插入的端到端框架,旨在发掘多模态大语言模型(MLLM)的环境感知推理潜力。我们的框架利用 MLLM 的链式思维(CoT)推理,以 Think-then-Place 的范式驱动视频扩散。为桥接认知推理与生成执行,我们引入了三个关键创新:首先,MLLM 执行物理场景理解和交互推理,生成环境感知的链式思维标记,并推断有效的插入区域,以显式引导扩散向物理上可行的插入方向。随后,我们引入 MLLM 指导的空间直接偏好优化(DPO),将扩散输出反馈给 MLLM 进行评分,从而实现视觉自然性。在推理过程中,MLLM 会依次触发精炼循环,并从扩散模型中激发出适应性调整,形成一个闭环,不断提升编辑质量。此外,我们提供两种用户可选择的模式:一种是以可行性为导向的灵活模式,允许环境修改(例如生成支撑结构)以增强物理可行性;另一种是以保真度为导向的标准模式,保持场景完整性以实现最大保真度,为用户提供对可行性与保真度之间的权衡的明确控制。广泛的实验表明,Place-it-R1 在与最先进解决方案和商业模型的比较下,实现了物理连贯的视频物体插入。

关键词

引用

@article{arxiv.2603.06140,
  title  = {Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion},
  author = {Bohai Gu and Taiyi Wu and Dazhao Du and Jian Liu and Shuai Yang and Xiaotong Zhao and Alan Zhao and Song Guo},
  journal= {arXiv preprint arXiv:2603.06140},
  year   = {2026}
}

备注

https://nevsnev.github.io/Place-it-R1/