LidarCLIP 或:我如何学会与点云对话
计算机视觉与模式识别
2023-05-03 v3 机器学习
摘要
连接文本与图像的研究最近取得了若干突破,出现了 CLIP、DALL-E 2 和 Stable Diffusion 等模型。然而,文本与其他视觉模态(如激光雷达数据)之间的联系受到的关注较少,受制于缺乏文本-激光雷达数据集。在这项工作中,我们提出 LidarCLIP,一种从汽车点云到已有 CLIP 嵌入空间的映射。利用图像-激光雷达对,我们以图像 CLIP 嵌入监督点云编码器,有效地以图像域为中介将文本与激光雷达数据关联起来。我们通过证明基于激光雷达的检索通常与基于图像的检索水平相当但具有互补的优势和劣势,展示了 LidarCLIP 的有效性。通过结合图像和激光雷达特征,我们改进了两种单模态方法,并实现了在恶劣传感器条件下针对具有挑战性检测场景的有针对性搜索。我们还探索了零样本分类,并表明 LidarCLIP 大幅优于现有将 CLIP 用于点云的尝试。最后,我们利用与 CLIP 的兼容性探索了一系列应用,如点云描述生成和激光雷达到图像生成,无需任何额外训练。代码和预训练模型可在 https://github.com/atonderski/lidarclip 获取。
引用
@article{arxiv.2212.06858,
title = {LidarCLIP or: How I Learned to Talk to Point Clouds},
author = {Georg Hess and Adam Tonderski and Christoffer Petersson and Kalle Åström and Lennart Svensson},
journal= {arXiv preprint arXiv:2212.06858},
year = {2023}
}