基于场景感知扩散模型的可控三维物体放置
计算机视觉与模式识别
2025-06-27 v1
摘要
随着强大的文本条件生成模型的出现,图像编辑方法变得更加强大和灵活。然而,在环境中进行精确位置和姿态的对象放置仍然是一个挑战,通常需要精心设计的填充掩码或提示。本文展示,经过精心设计的视觉图,结合粗糙的对象掩码,即可实现高质量的对象放置。我们设计的条件信号能够消除歧义,同时足够灵活,以允许更改形状或对象姿态。通过基于填充模型构建,本方法默认保持背景不变,与那些同时建模对象和背景的方法不同。我们在汽车领域展示了方法的有效性,比较了不同的条件信号在新对象放置任务中的表现。这些任务旨在衡量编辑质量,不仅包括外观,还包括姿态和位置精度,包括需要非平凡形状变化的情况。最后,我们展示了精细位置控制可以与外观控制结合,用于在场景中将现有对象放置到精确位置。
引用
@article{arxiv.2506.21446,
title = {Controllable 3D Placement of Objects with Scene-Aware Diffusion Models},
author = {Mohamed Omran and Dimitris Kalatzis and Jens Petersen and Amirhossein Habibian and Auke Wiggers},
journal= {arXiv preprint arXiv:2506.21446},
year = {2025}
}