基于多模态预训练的多任务三维建筑理解
计算机视觉与模式识别
2023-06-21 v1 图像与视频处理
摘要
本文探讨了在BuildingNet数据集上进行三维建筑类型分类与部件分割的多种学习策略。我们将ULIP结合PointNeXt以及PointNeXt分割扩展用于BuildingNet数据集上的分类与分割任务。具有多模态预训练的最佳多任务PointNeXt-s模型在验证集上取得59.36的三维建筑类型分类总体精度,以及31.68的部件IoU(PartIoU)用于三维建筑部件分割。最终的PointNeXt XL模型在测试集上取得31.33的PartIoU与22.78的形状IoU(ShapeIoU)用于BuildingNet-Points分割,较BuildingNet论文所报告的PointNet++模型有显著提升,并荣获CVPR23 StruCo3D研讨会上BuildingNet挑战赛第一名。
引用
@article{arxiv.2306.10146,
title = {Multi-task 3D building understanding with multi-modal pretraining},
author = {Shicheng Xu},
journal= {arXiv preprint arXiv:2306.10146},
year = {2023}
}
备注
8 pages, 9 figures, 9 tables