用于密集环境顺序操纵的目感空间推理学习
机器人学
2026-03-04 v1 人工智能
摘要
在密集环境中的机器人操纵是自动化的一个关键挑战。最近的大规模端到端模型展现了惊人的能力,但往往缺乏从密集 clutter 中检索目标所需的数据效率和模块化。本文我们认为,采用专业的、解耦的系统范式是合理的,并提出Unveiler框架,显式地将高层空间推理与低层动作执行分离。Unveiler的核心是一个轻量级的基于Transformer的空间关系编码器(Spatial Relationship Encoder, SRE),其顺序识别最关键的障碍物以供移除。这种离散决策随后传递给一个旋转不变的动作解码器进行执行。我们展示,该解耦架构不仅在参数数量和推理时间方面更具计算效率,而且在从密集 clutter 中检索目标方面显著优于经典端到端策略和现代大型模型基准。在SRE的训练中采用两种阶段:仿造学习从启发式演示中提供样本高效初始化,随后采用PPO微调,使策略能够发现超越启发式方法的移除策略,以应对密集 clutter。我们的结果在部分遮挡场景下实现最高达97.6%的成功率,在完全遮挡场景下达90.0%的成功率,证明了在复杂操纵任务中专业的、以对象为中心的推理的强大能力。此外,我们展示SRE的空间推理能够零样本地迁移到真实场景,并在物理机器人上验证了整个系统,只需几何工作空间校准即可——无需重新训练任何已学习组件。
关键词
引用
@article{arxiv.2603.02511,
title = {Learning Object-Centric Spatial Reasoning for Sequential Manipulation in Cluttered Environments},
author = {Chrisantus Eze and Ryan C Julian and Christopher Crick},
journal= {arXiv preprint arXiv:2603.02511},
year = {2026}
}