RAZER: 基于时空聚合的鲁棒加速零样本3D开放词汇全景重建
计算机视觉与模式识别
2025-05-22 v1 机器人学
摘要
映射和理解复杂的3D环境是自主系统感知和与物理世界交互的基础,需要精确的几何重建和丰富的语义理解。虽然现有的3D语义映射系统在重建和识别预定义对象实例方面表现出色,但它们缺乏在在线操作中高效构建开放词汇语义地图的灵活性。尽管最近的视觉-语言模型已实现2D图像中的开放词汇目标识别,但它们尚未弥合到3D空间理解的差距。关键挑战在于开发一个无需训练的统一系统,能够同时构建精确的3D地图,保持语义一致性,并支持实时自然语言交互。在本文中,我们开发了一个零样本框架,通过在线实例级语义嵌入融合,将GPU加速的几何重建与开放词汇视觉-语言模型无缝集成,并以分层对象关联与空间索引为指导。该无需训练的系统通过增量处理和统一的几何-语义更新实现了优越性能,同时鲁棒地处理2D分割不一致性。所提出的通用3D场景理解框架可用于多种任务,包括零样本3D实例检索、分割和目标检测,以推理先前未见的目标并解释自然语言查询。项目页面位于 https://razer-3d.github.io。
引用
@article{arxiv.2505.15373,
title = {RAZER: Robust Accelerated Zero-Shot 3D Open-Vocabulary Panoptic Reconstruction with Spatio-Temporal Aggregation},
author = {Naman Patel and Prashanth Krishnamurthy and Farshad Khorrami},
journal= {arXiv preprint arXiv:2505.15373},
year = {2025}
}