中文

通过语义感知 GNN 提高姿态估计

计算机视觉与模式识别 2025-03-24 v1

摘要

姿态估计是自动驾驶中的关键任务,传统上依赖于 2D 图像基模型。在本工作中,我们探讨了通过结合 3D 神经网络模型与循环神经网络 (RNN) 进行时序建模、以基于 LiDAR 的点云作为输入来融合 3D 空间信息的优势。我们系统评估了四种混合 3D 模型,所有模型都优于仅基于 2D 的基线模型,其中图神经网络 (GNN) -RNN 模型取得了最佳成绩。为了减少对 LiDAR 的依赖,我们利用预训练的统一模型从单目图像估计深度,从而重建伪 3D 点云。我们将原为 LiDAR 点云设计的 GNN-RNN 模型适配到这些伪 3D 表示上,实现了与 LiDAR 基模型相当甚至更好的性能。此外,统一模型为每个点提供语义标签,使场景表示更具结构性。为进一步优化图构建,我们引入一种高效的连接策略:连接主要在同一语义类别之间的点上形成,仅保留 20% 的跨类别连接。这一针对性方法降低了图的复杂度和计算成本,同时保持了关键的空间关系。最后,我们在 KITTI 数据集上对我们的方案进行了验证,实现了相对于 2D 基模型的 71% 性能提升。我们的发现凸显了 3D 空间信息和高效图构建在姿态估计中的优势,同时保持了单目图像的经济性,避免了 LiDAR 系统的高额成本。

关键词

引用

@article{arxiv.2503.17153,
  title  = {Enhancing Steering Estimation with Semantic-Aware GNNs},
  author = {Fouad Makiyeh and Huy-Dung Nguyen and Patrick Chareyre and Ramin Hasani and Marc Blanchon and Daniela Rus},
  journal= {arXiv preprint arXiv:2503.17153},
  year   = {2025}
}

备注

Submitted to ICCV 2025