CLIP-Layout:基于语义家具嵌入的风格一致室内场景合成
计算机视觉与模式识别
2023-06-05 v2
摘要
室内场景合成涉及在户型平面上自动选取并合理摆放家具,使场景看起来真实且在功能上合理。此类场景可作为沉浸式 3D 体验的居所,或用于训练具身智能体。该任务的现有方法依赖家具的标注类别(如床、椅或桌)来生成上下文相关的家具组合。无论基于启发式还是学习式,这些方法忽略物体的实例级视觉属性,因此可能产生视觉连贯性较差的场景。本文引入一种自回归场景模型,可利用基于 CLIP 的通用图像嵌入输出实例级预测。这使我们能够学习颜色与风格匹配等视觉对应关係,并生成功能上更合理、美学上更愉悦的场景。在 3D-FRONT 数据集上评估,我们的模型在场景合成中取得 SOTA 结果,并将自动补全指标提升逾 50%。此外,我们基于嵌入的方法支持零样本文本引导的场景合成与编辑,可轻松泛化至训练期间未见的家具。
引用
@article{arxiv.2303.03565,
title = {CLIP-Layout: Style-Consistent Indoor Scene Synthesis with Semantic Furniture Embedding},
author = {Jingyu Liu and Wenhan Xiong and Ian Jones and Yixin Nie and Anchit Gupta and Barlas Oğuz},
journal= {arXiv preprint arXiv:2303.03565},
year = {2023}
}
备注
Changed paper template and cleaned up tables