中文

Lay-A-Scene:利用文本到图像先验进行个性化3D物体排列

计算机视觉与模式识别 2024-06-05 v2

摘要

生成3D视觉场景处于视觉生成式人工智能的前沿,但当前的3D生成技术在生成包含多个高分辨率物体的场景时存在困难。在此,我们介绍Lay-A-Scene,它解决了开放集3D物体排列任务,能够有效地排列未见过的物体。给定一组3D物体,任务是找到这些物体在场景中的合理排列。我们通过利用预训练的文本到图像模型来解决此任务。我们对模型进行个性化处理,并解释如何生成包含多个预定义物体且不忽略其中任何一个的场景图像。然后,我们描述了如何通过找到物体在2D场景上的一致投影,从2D生成图像中推断出物体的3D姿态和排列。我们使用来自Objaverse的3D物体和人类评估者评估了Lay-A-Scene的质量,发现它通常能生成连贯且可行的3D物体排列。

关键词

引用

@article{arxiv.2406.00687,
  title  = {Lay-A-Scene: Personalized 3D Object Arrangement Using Text-to-Image Priors},
  author = {Ohad Rahamim and Hilit Segev and Idan Achituve and Yuval Atzmon and Yoni Kasten and Gal Chechik},
  journal= {arXiv preprint arXiv:2406.00687},
  year   = {2024}
}