揭示空间:从室内空间图像中提取具有建筑意义的语义描述
计算机视觉与模式识别
2023-12-21 v1
摘要
过去十年间,计算机视觉工具和技术在建筑设计工作流中的采用率日益增长。显著的应用案例包括点云生成、视觉内容分析以及用于机器人制造的空间感知。多种图像分类、目标检测和语义像素分割模型已广泛用于从二维图像和视频中提取高层符号描述和语义内容。然而,这方面的一个主要挑战是从多样化的图像中提取高层建筑结构(如墙、地板、天花板、窗户等),因为这些元素的部分常被家具、人员或其他非建筑元素遮挡。本项目旨在通过提出能够从有人居住的室内空间二维场景中提取具有建筑意义的语义描述的模型来解决这一问题。我们参数化生成了 1000 个虚拟教室,沿长度、宽度、高度和门窗位置等关键空间参数进行随机化。相机位置以及非建筑视觉障碍物(家具/物体)的位置也进行了随机化。我们在这些围护结构的合成渲染图像及其代表高层建筑结构的相关图像抽象上,训练了一个用于图像到图像翻译的生成对抗网络(GAN)(Pix2Pix)。随后,该模型在未见过的新型围护结构的合成图像上进行测试,并通过像素级比较将输出与真值进行对比评估。类似的模型评估也在现有室内围护结构的照片上进行,以衡量其在现实世界设置中的性能。
引用
@article{arxiv.2312.12481,
title = {Unveiling Spaces: Architecturally meaningful semantic descriptions from images of interior spaces},
author = {Demircan Tas and Rohit Priyadarshi Sanatani},
journal= {arXiv preprint arXiv:2312.12481},
year = {2023}
}
备注
Written for 6.869, Advances in Computer Vision at MIT, Spring 2022. 9 pages, 13 figures