SpatialActor:探索解耦空间表征以提升机器人操作鲁棒性
机器人学
2026-01-14 v2 计算机视觉与模式识别
摘要
机器人操作需要精确的空间理解才能与现实世界中的物体进行交互。基于点的 methods 受稀疏采样的限制,导致细粒度语义信息丢失。基于图像的方法通常将 RGB 和深度输入到 2D 主干网络,这些网络在 3D 辅助任务上预训练,但其 entangled 的语义和几何信息对现实世界中固有的深度噪声敏感,可能干扰语义理解。此外,这些方法关注高层几何,却忽略了精确交互所必需的低层空间线索。我们提出 SpatialActor,一个用于鲁棒机器人操作的解耦框架,显式地分离语义和几何。语义引导的几何模块自适应地融合来自噪声深度和语义引导的专家先验的两种互补几何。此外,空间变换器利用低层空间线索进行准确的 2D-3D 映射,促进空间特征之间的相互作用。在多个仿真和真实世界场景中进行 50 多个任务的评估显示,SpatialActor 实现了最先进的性能,RLBench 上达到 87.4%,在各种噪声条件下提升 13.9% 到 19.4%,显示出强大的鲁棒性。此外,它显著增强了对新任务的零样本泛化能力,并在各种空间扰动下保持鲁棒性。项目页面:https://shihao1895.github.io/SpatialActor
引用
@article{arxiv.2511.09555,
title = {SpatialActor: Exploring Disentangled Spatial Representations for Robust Robotic Manipulation},
author = {Hao Shi and Bin Xie and Yingfei Liu and Yang Yue and Tiancai Wang and Haoqiang Fan and Xiangyu Zhang and Gao Huang},
journal= {arXiv preprint arXiv:2511.09555},
year = {2026}
}
备注
AAAI 2026 Oral | Project Page: https://shihao1895.github.io/SpatialActor