OBJECT 3DIT:语言引导的3D感知图像编辑
计算机视觉与模式识别
2023-07-21 v1 人工智能
图形学
摘要
现有图像编辑工具虽然强大,但通常忽略图像所投影自的底层3D几何。因此,使用这些工具进行的编辑可能脱离作为图像形成过程基础的几何与光照条件。在本工作中,我们提出语言引导的3D感知编辑这一新任务,其中图像中的物体应根据底层3D场景语境下的语言指令进行编辑。为推动朝此目标进展,我们发布OBJECT:一个由程序化生成的3D场景创建的包含40万编辑示例的数据集。每个示例由输入图像、语言编辑指令与编辑后图像组成。我们还提出3DIT:用于四项编辑任务的单任务与多任务模型。我们的模型展现出理解整场景3D构成、考量周围物体、表面、光照条件、阴影与物理合理物体配置的惊人能力。令人惊讶的是,仅在OBJECT的合成场景上训练,3DIT的编辑能力可泛化至真实世界图像。
引用
@article{arxiv.2307.11073,
title = {OBJECT 3DIT: Language-guided 3D-aware Image Editing},
author = {Oscar Michel and Anand Bhattad and Eli VanderBilt and Ranjay Krishna and Aniruddha Kembhavi and Tanmay Gupta},
journal= {arXiv preprint arXiv:2307.11073},
year = {2023}
}