探究基于点云的车辆分类的视觉语言模型
计算机视觉与模式识别
2025-04-14 v1
摘要
重型卡车因其巨大的尺寸和有限的机动性而面临重大的安全挑战。深入了解卡车特征对于增强合作式自动驾驶的安全观点至关重要。传统的基于 LiDAR 的卡车分类方法依赖于大量手动标注,因而既费时又昂贵。快速发展的大型语言模型(LLM)在大规模数据集上进行训练,为利用其few-shot学习能力进行卡车分类提供了机会。然而,现有的视觉语言模型(VLM)主要在图像数据集上进行训练,难以直接处理点云数据。本研究引入一种新框架,将路边 LiDAR 点云数据与 VLM 集成,以实现高效且准确的卡车分类,支持合作且安全的驾驶环境。本研究引入了三个关键创新:(1) 利用真实世界的 LiDAR 数据集进行模型开发,(2) 设计一种预处理流程来适配点云数据以用于 VLM 输入,包括点云配准以实现稠密 3D 渲染和数学形态学技术以增强特征表示,(3) 利用in-context学习进行few-shot提示,以实现最少标注训练数据的车辆分类。实验结果表明,该方法表现出鼓舞人心的性能,并展示了其减少标注工作量的潜力,同时提高分类准确率的潜力。
关键词
引用
@article{arxiv.2504.08154,
title = {Investigating Vision-Language Model for Point Cloud-based Vehicle Classification},
author = {Yiqiao Li and Jie Wei and Camille Kamga},
journal= {arXiv preprint arXiv:2504.08154},
year = {2025}
}
备注
5 pages,3 figures, 1 table, CVPR DriveX workshop