BlenderFusion:3D grounding 视觉编辑与生成合成
计算机视觉与模式识别
2025-09-03 v2 图形学
摘要
我们提出 BlenderFusion,一个生成视觉合成框架,通过重组对象、相机和背景来合成新场景。它遵循分层-编辑-合成管线:(i) 将视觉输入分割并转换为可编辑的 3D 实体(分层),(ii) 在 Blender 中进行 3D grounding 控制编辑,(iii) 使用生成式合成器将其融合为连贯场景。我们的生成式合成器扩展了预训练扩散模型,可并行处理原始 (source) 和编辑后 (target) 场景。它基于视频帧进行微调,采用两项关键训练策略:(i) source masking,实现灵活的背景替换;(ii) 模拟对象抖动,实现对对象和相机的无缝控制。BlenderFusion 在复杂的构图场景编辑任务中显著优于先前方法。
引用
@article{arxiv.2506.17450,
title = {BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing},
author = {Jiacheng Chen and Ramin Mehran and Xuhui Jia and Saining Xie and Sanghyun Woo},
journal= {arXiv preprint arXiv:2506.17450},
year = {2025}
}
备注
Project page: https://blenderfusion.github.io