Talk2PC:通过融合激光雷达与雷达点云增强自动驾驶的3D视觉定位
计算机视觉与模式识别
2025-09-15 v2
摘要
具身化室外场景理解构成了自主智能体感知、分析和应对动态驾驶环境的基础。然而,现有的3D理解主要基于2D视觉语言模型(Vision-Language Models, VLMs),其收集和处理的场景感知上下文有限。相比之下,与2D平面视觉信息相比,LiDAR等点云传感器提供了物体丰富的深度和细粒度的3D表示。更进一步,新兴的4D毫米波雷达能够检测每个物体的运动趋势、速度和反射强度。这两种模态的融合为自然语言提供了更灵活的查询条件,从而支持更准确的3D视觉定位。为此,我们提出了一种名为TPCNet的新方法,这是首个基于提示引导的点云传感器组合范式(包括LiDAR和雷达传感器)的室外3D视觉定位模型。为了最优地组合提示所需的这两种传感器特征,我们设计了一种称为两阶段异构模态自适应融合的多融合范式。具体而言,该范式首先采用双向代理交叉注意力(Bidirectional Agent Cross-Attention, BACA),将具有全局感受野的双传感器特征输入到文本特征中进行查询。此外,我们设计了一个动态门控图融合(Dynamic Gated Graph Fusion, DGGF)模块,以定位由查询识别出的感兴趣区域。为了进一步提高准确性,我们基于距离自车最近的物体边缘设计了一个C3D-RECHead。实验结果表明,我们的TPCNet及其各个模块在Talk2Radar和Talk2Car数据集上均取得了最先进的性能。我们在 https://github.com/GuanRunwei/TPCNet 发布了代码。
引用
@article{arxiv.2503.08336,
title = {Talk2PC: Enhancing 3D Visual Grounding through LiDAR and Radar Point Clouds Fusion for Autonomous Driving},
author = {Runwei Guan and Jianan Liu and Ningwei Ouyang and Shaofeng Liang and Daizong Liu and Xiaolou Sun and Lianqing Zheng and Ming Xu and Yutao Yue and Guoqiang Mao and Hui Xiong},
journal= {arXiv preprint arXiv:2503.08336},
year = {2025}
}
备注
13 pages, 12 figures