中文

Talk to Parallel LiDARs:基于 3D 视觉 grounding 的人类-LiDAR 交互方法

计算机视觉与模式识别 2024-05-27 v1 人机交互

摘要

LiDAR 传感器在各种应用中发挥着关键作用,特别是在自动驾驶领域。当前研究主要聚焦于将点云数据作为输入以优化感知模型,而对更深层次认知智能的探索相对有限。为解决这一挑战,平行 LiDARs 作为下一代智能 LiDAR 系统的新型理论框架已出现,紧密集成了物理、数字和社会系统。为赋予 LiDAR 系统认知能力,我们将 3D 视觉 grounding 任务引入平行 LiDARs,并提出了一种新的人机交互范式。我们提出了 Talk2LiDAR,一个为 3D 视觉 grounding 在自动驾驶领域量身定制的大规模基准数据集。此外,我们提出了一个两阶段基线方法和一个高效的单阶段方法 BEVGrounding,通过融合粗粒度句子和细粒度词嵌入与视觉特征,显著提高了 grounding 准确率。我们在 Talk2Car-3D 和 Talk2LiDAR 数据集上的实验表明,BEVGrounding 性能卓越,为该领域的进一步研究奠定了基础。

关键词

引用

@article{arxiv.2405.15274,
  title  = {Talk to Parallel LiDARs: A Human-LiDAR Interaction Method Based on 3D Visual Grounding},
  author = {Yuhang Liu and Boyi Sun and Guixu Zheng and Yishuo Wang and Jing Wang and Fei-Yue Wang},
  journal= {arXiv preprint arXiv:2405.15274},
  year   = {2024}
}