中文

HumanoidPano:面向人形机器人的混合球面全景-LiDAR 跨模态感知

机器人学 2025-03-14 v2

摘要

由于固有的结构约束导致严重的自遮挡和有限的视野(FOV),人形机器人的感知系统设计提出了独特的挑战。我们提出了 HumanoidPano,一种新型混合跨模态感知框架,协同整合全景视觉与 LiDAR 传感以克服这些限制。不同于依赖单目相机或标准多传感器配置的传统机器人感知系统,我们的方法通过球面视觉 transformer 建立具有几何感知的模态对齐,实现了 360 度视觉上下文与 LiDAR 精确深度测量的无缝融合。首先,球面几何感知约束(SGC)利用全景相机射线属性,引导畸变正则化采样偏移以实现几何对齐。其次,空间可变形注意力(SDA)通过球面偏移聚合分层 3D 特征,实现了从 360 度到 BEV 的高效融合以及几何完整的物体表示。第三,全景增强(AUG)结合跨视图变换和语义对齐,以增强数据增强期间 BEV-全景特征的一致性。广泛的评估表明,该方法在 360BEV-Matterport 基准上达到了 SOTA 性能。在人形平台上的真实世界部署验证了该系统通过全景-LiDAR 协同感知生成精确 BEV 分割图的能力,直接赋能复杂环境中的下游导航任务。我们的工作为人形机器人中的具身感知确立了新范式。

关键词

引用

@article{arxiv.2503.09010,
  title  = {HumanoidPano: Hybrid Spherical Panoramic-LiDAR Cross-Modal Perception for Humanoid Robots},
  author = {Qiang Zhang and Zhang Zhang and Wei Cui and Jingkai Sun and Jiahang Cao and Yijie Guo and Gang Han and Wen Zhao and Jiaxu Wang and Chenghao Sun and Lingfeng Zhang and Hao Cheng and Yujie Chen and Lin Wang and Jian Tang and Renjing Xu},
  journal= {arXiv preprint arXiv:2503.09010},
  year   = {2025}
}

备注

Technical Report