桥接路侧激光雷达的模态差距:面向车辆分类的无训练视觉语言模型框架
计算机视觉与模式识别
2026-02-11 v1 机器学习
摘要
精细化车辆分类对于智能交通系统(ITS)至关重要,但当前基于激光雷达的方法因依赖监督式深度学习和耗时的手动标注,面临可扩展性挑战。视觉语言模型(VLM)在few-shot泛化方面展现出巨大潜力,但因稀疏3D点云与密集2D图像之间的模态差距,其在路侧激光雷达中的应用受到限制。我们提出一种框架,通过适配现成VLM实现车辆分类的无参数微调。我们新构建的深度感知图像生成管线应用噪声消除、空间与时间配准、姿态校正、形态学操作和各向异性平滑,将稀疏、遮挡的激光雷达扫描转换为深度编码的2D视觉代理。该方法在20类真实车辆数据集上验证,仅需每类16-30个样本即可达到竞争性的分类准确率,为数据密集型监督基线提供可扩展的替代方案。我们进一步观察到一种“语义锚”效应:文本导向的指导在极低样本 regime()中正则化性能,但在较高样本设置下因语义不匹配而降低准确率。此外,我们展示了该框架作为Cold Start策略的有效性,通过VLM生成的标签引导轻量级监督模型。值得注意的是,基于few-shot的VLM模型在特定卡车类别(20尺、40尺和53尺集装箱)中实现了超过75%的正确分类率,完全无需耗时的训练或微调,显著降低了ITS应用中初始人工标注的强烈需求,实现了实用性方法。
引用
@article{arxiv.2602.09425,
title = {Bridging the Modality Gap in Roadside LiDAR: A Training-Free Vision-Language Model Framework for Vehicle Classification},
author = {Yiqiao Li and Bo Shang and Jie Wei},
journal= {arXiv preprint arXiv:2602.09425},
year = {2026}
}
备注
12 pages, 10 figures, 4 tables