Normal Transformer:由视觉语义增强的 LiDAR 点云表面几何提取
计算机视觉与模式识别
2025-02-13 v3
摘要
高质量表面法线有助于改进自动驾驶所面临问题中的几何估计,如碰撞规避与遮挡推断。尽管大量文献聚焦于稠密扫描的室内场景,但由于真实世界 LiDAR 扫描的稀疏、非均匀与含噪特性,自动驾驶中的法线估计仍是一个复杂问题。本文提出一种利用 LiDAR 与相机传感器所获 3D 点云与 2D 彩色图像进行表面法线估计的多模态技术。我们提出混合几何 Transformer(HGT),一种新颖的基于 transformer 的神经网络架构,可熟练融合视觉语义与 3D 几何信息。此外,我们为多模态数据开发了有效的学习策略。实验结果表明,相较于现有方法,我们的信息融合方法具有更优的有效性。同时验证了所提模型能从模拟交通场景的 3D 环境中学习。所学几何知识可迁移并应用于 KITTI 数据集中的真实世界 3D 场景。基于 KITTI 数据集中估计法向量构建的进一步任务表明,所提估计器相较现有方法具有优势。
引用
@article{arxiv.2211.10580,
title = {Normal Transformer: Extracting Surface Geometry from LiDAR Points Enhanced by Visual Semantics},
author = {Ancheng Lin and Jun Li and Yusheng Xiang and Wei Bian and Mukesh Prasad},
journal= {arXiv preprint arXiv:2211.10580},
year = {2025}
}