中文

SGAligner++: 跨模态语言辅助的 3D 场景图对齐

计算机视觉与模式识别 2025-10-17 v2 机器人学

摘要

3D 场景图对齐是机器人导航和具身感知等多个应用的关键初始步骤。现有的 3D 场景图对齐方法通常依赖单一模态的点云数据,在处理不完整或有噪声的输入时表现不佳。我们提出了 SGAligner++,一个跨模态、语言辅助的 3D 场景图对齐框架。我们的方法通过学习统一的联合嵌入空间来解决跨异质模态的部分重叠场景观测对齐问题,即使在低重叠条件和传感器噪声下也能实现精确对齐。通过采用轻量级单模态编码器和基于注意力的融合机制,SGAligner++ 增强了场景理解能力,适用于视觉定位、3D 重建和导航等任务,同时确保可扩展性和最小的计算开销。在真实世界数据集上的大量评估表明,SGAligner++ 在噪声真实重建上以高达 40% 的优势超越最先进方法,同时实现了跨模态泛化。

关键词

引用

@article{arxiv.2509.20401,
  title  = {SGAligner++: Cross-Modal Language-Aided 3D Scene Graph Alignment},
  author = {Binod Singh and Sayan Deb Sarkar and Iro Armeni},
  journal= {arXiv preprint arXiv:2509.20401},
  year   = {2025}
}

备注

Project Page: https://singhbino3d.github.io/sgpp/