中文

SAM4D:摄像头和激光雷达流中的全景分割

计算机视觉与模式识别 2025-06-27 v1 机器人学

摘要

我们提出 SAM4D,这是一个多模态时序基础模型,旨在实现摄像头和激光雷达流中的可提示分割。引入统一多模态位置编码(Unified Multi-modal Positional Encoding,简称 UMPE),以共享三维空间对齐摄像头和激光雷达特征,实现无缝的跨模态提示和交互。此外,我们提出了基于运动感知的跨模态记忆注意力(Motion-aware Cross-modal Memory Attention,简称 MCMA),利用自车运动补偿来增强时序一致性和长程特征检索,确保在动态变化的自动驾驶场景中实现稳健的分割。为避免标注瓶颈,我们开发了一个多模态自动化数据引擎,融合 VFM 驱动的视频掩码块、时空 4D 重建和跨模态掩码块融合。该框架以数量级速度快于人工标注,同时保持 VFM 提取的语义保真度于点云表示。我们在构建的 Waymo-4DSeg 上进行大规模实验,证明了 SAM4D 的强大跨模态分割能力及其在数据标注中的巨大潜力。

关键词

引用

@article{arxiv.2506.21547,
  title  = {SAM4D: Segment Anything in Camera and LiDAR Streams},
  author = {Jianyun Xu and Song Wang and Ziqian Ni and Chunyong Hu and Sheng Yang and Jianke Zhu and Qiang Li},
  journal= {arXiv preprint arXiv:2506.21547},
  year   = {2025}
}

备注

Accepted by ICCV2025, Project Page: https://SAM4D-Project.github.io