使用语言视觉模型在移动 LiDAR 中进行建筑物的零样本检测
计算机视觉与模式识别
2025-09-29 v1 人工智能
摘要
近期进展表明,语言视觉模型在二维(2D)计算机视觉任务中超越了现有的最先进水平,这促使人们尝试将 LVMs 应用于三维(3D)数据。尽管 LVMs 在无需训练即可解决各种下游 2D 视觉任务方面高效且有效,但在处理点云(表示 3D 数据的代表性格式)时面临重大挑战。从 3D 数据中提取特征更为困难,且由于数据量大以及采集和标注成本高昂带来了诸多挑战,导致数据集的可用性明显受限。此外,由于对大量数据和训练时间的要求,为点云构建 LVMs 甚至更具挑战性。为了解决这些问题,我们的研究旨在 1) 通过球面投影应用 Grounded SAM 以将 3D 转换为 2D,以及 2) 使用合成数据进行实验,以评估其在弥合合成数据与真实世界数据领域之间差距方面的有效性。我们的方法表现出高性能,准确率为 0.96,IoU 为 0.85,精确率为 0.92,召回率为 0.91,F1 分数为 0.92,证实了其潜力。然而,在未来的研究中,仍有诸如球面图像生成过程中的遮挡问题和多标签点的像素级重叠等挑战需要解决。
引用
@article{arxiv.2404.09931,
title = {Zero-shot detection of buildings in mobile LiDAR using Language Vision Model},
author = {June Moh Goo and Zichao Zeng and Jan Boehm},
journal= {arXiv preprint arXiv:2404.09931},
year = {2025}
}
备注
7 pages, 6 figures, conference