中文

BlenderFusion:3D grounding 视觉编辑与生成合成

计算机视觉与模式识别 2025-09-03 v2 图形学

摘要

我们提出 BlenderFusion,一个生成视觉合成框架,通过重组对象、相机和背景来合成新场景。它遵循分层-编辑-合成管线:(i) 将视觉输入分割并转换为可编辑的 3D 实体(分层),(ii) 在 Blender 中进行 3D grounding 控制编辑,(iii) 使用生成式合成器将其融合为连贯场景。我们的生成式合成器扩展了预训练扩散模型,可并行处理原始 (source) 和编辑后 (target) 场景。它基于视频帧进行微调,采用两项关键训练策略:(i) source masking,实现灵活的背景替换;(ii) 模拟对象抖动,实现对对象和相机的无缝控制。BlenderFusion 在复杂的构图场景编辑任务中显著优于先前方法。

关键词

引用

@article{arxiv.2506.17450,
  title  = {BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing},
  author = {Jiacheng Chen and Ramin Mehran and Xuhui Jia and Saining Xie and Sanghyun Woo},
  journal= {arXiv preprint arXiv:2506.17450},
  year   = {2025}
}

备注

Project page: https://blenderfusion.github.io