面向准确长期机器人操作:基于场景图的语言到动作 foundation model 方法
机器人学
2025-11-03 v1 人工智能
机器学习
摘要
本文提出了一种框架,利用预训练的 foundation model 进行机器人操作,不需要特定领域的训练。 该框架集成了即插即用模型,结合 foundation model 的多模态感知与具备稳健任务序列规划能力的通用推理模型。 动态维护的场景图提供了空间感知能力,使框架能够就环境进行一致的推理。 通过一系列桌面机器人操作实验评估了该框架,结果突显了其在基于即插即用 foundation model 构建机器人操作系统的潜力。
引用
@article{arxiv.2510.27558,
title = {Toward Accurate Long-Horizon Robotic Manipulation: Language-to-Action with Foundation Models via Scene Graphs},
author = {Sushil Samuel Dinesh and Shinkyu Park},
journal= {arXiv preprint arXiv:2510.27558},
year = {2025}
}