P$^3$数据集:用于多模态建筑矢量化的数据集
计算机视觉与模式识别
2025-05-22 v1
摘要
我们提出了P数据集,这是一个来自三大大洲的航空激光点云、高分辨率航空图像和矢量化二维建筑轮廓线构成的大规模多模态基准数据集。该数据集包含超过100亿个激光点,精度达到厘米级,RGB图像的地面采样距离为25厘米。虽然许多现有数据集主要聚焦于图像模态,而P提供了另一种视角,同时融合了稠密的3D信息。我们证明了激光点云作为预测建筑多边形的可靠模态,在混合学习框架和端到端学习框架中均表现良好。此外,融合航空激光和图像数据可进一步提高预测多边形的准确性和几何质量。P数据集已公开提供,附带代码和三个主流建筑多边形预测模型的预训练权重,访问地址为 https://github.com/raphaelsulzer/PixelsPointsPolygons 。
引用
@article{arxiv.2505.15379,
title = {The P$^3$ dataset: Pixels, Points and Polygons for Multimodal Building Vectorization},
author = {Raphael Sulzer and Liuyun Duan and Nicolas Girard and Florent Lafarge},
journal= {arXiv preprint arXiv:2505.15379},
year = {2025}
}