中文

T-Rex:面向机器人操控的任务自适应空间表征提取

机器人学 2025-06-25 v1 人工智能

摘要

构建能够在真实场景中执行多种任务的通用机器人操控系统是一个具有挑战性的任务。视觉-语言模型(VLM)因从大规模数据集中获得的广泛世界知识,在机器人操控任务中展现出巨大的潜力。在此过程中,空间表征(如表示物体位置的点或表示物体姿态的向量)充当了VLM与真实场景之间的桥梁,有效地将VLM的推理能力 grounding 到具体任务情境中并使之落地。然而,现有的VLM-based机器人方法通常为各种任务采用固定的空间表征提取方案,导致表征能力不足或提取时间过长。本文引入T-Rex,即一种用于空间表征提取的任务自适应框架,根据具体任务要求动态选择每个实体最合适的空间表征提取方案。我们的关键洞察是,任务复杂度决定了空间表征的类型和细粒度,更强的表征能力通常与更高的整体系统运行成本相关联。通过在真实机器人环境中的全面实验,我们表明该方法在空间理解、效率和稳定性方面显著优于其他方法,且无需额外训练。

关键词

引用

@article{arxiv.2506.19498,
  title  = {T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models},
  author = {Yiteng Chen and Wenbo Li and Shiyi Wang and Huiping Zhuang and Qingyao Wu},
  journal= {arXiv preprint arXiv:2506.19498},
  year   = {2025}
}

备注

submitted to NeurIPS 2025