TexLiDAR:用于全景 LiDAR 数据的自动文本理解
计算机视觉与模式识别
2025-02-24 v2 人工智能
摘要
将 LiDAR 数据与文本连接的努力,例如 LidarCLIP,主要侧重于将 3D 点云嵌入 CLIP 文本-图像空间。然而,这些方法依赖于 3D 点云,在编码效率和神经网络处理方面存在挑战。随着先进 LiDAR 传感器如 Ouster OS1 的出现,这些传感器不仅产生 3D 点云,还产生固定分辨率的深度、信号和 ambient 全景 2D 图像,为 LiDAR 任务带来了新的机遇。在本工作中,我们提出了一种通过利用 OS1 传感器生成的 2D 图像而非 3D 点云来将 LiDAR 数据与文本连接的方法。我们在零样本设置下使用 Florence 2 大型模型进行图像描述生成和目标检测。我们的实验表明,Florence 2 生成更具信息性的描述,并在目标检测任务中实现卓越的性能,优于 CLIP 等现有方法。通过将先进的 LiDAR 传感器数据与大型预训练模型结合, Our 方法为具有挑战性的检测情景(包括需要高精度和鲁棒性的实时应用)提供了一个稳健且准确的解决方案。
关键词
引用
@article{arxiv.2502.04385,
title = {TexLiDAR: Automated Text Understanding for Panoramic LiDAR Data},
author = {Naor Cohen and Roy Orfaig and Ben-Zion Bobrovsky},
journal= {arXiv preprint arXiv:2502.04385},
year = {2025}
}