中文

通过模块化具身智能实现结构化任务求解:以魔方为例

机器人学 2025-07-09 v1

摘要

本文提出了Auto-RubikAI,一个模块化自主规划框架,它集成了符号知识库(KB)、视觉语言模型(VLM)和大语言模型(LLM),用于解决以魔方还原为例的结构化操作任务。与基于预定义脚本的传统机器人系统,或依赖预训练网络和大规模演示数据的现代方法不同,Auto-RubikAI能够在数据需求极低且无需事先演示的情况下,实现可解释的多步骤任务执行。该系统采用知识库模块来求解群论层面的还原步骤,克服了LLM在符号推理方面的局限性。视觉语言模型解析RGB-D输入以构建语义3D场景表示,而LLM则通过提示链生成结构化的机器人控制代码。这种三模块架构确保了在空间不确定性下的鲁棒性能。我们在仿真和真实环境中使用7自由度机械臂部署了Auto-RubikAI,展示了无需重新训练即可实现有效的仿真到现实迁移。实验表明,在随机配置下,端到端任务成功率达到79%。与CFOP、DeepCubeA和Two-Phase基线相比,我们基于知识库增强的方法在保持可解释性和安全性的同时,减少了平均求解步骤。Auto-RubikAI为智能制造、机器人教育和自主执行场景中的具身任务规划提供了一个经济高效的模块化基础。代码、提示和硬件模块将在发表后发布。

关键词

引用

@article{arxiv.2507.05607,
  title  = {Structured Task Solving via Modular Embodied Intelligence: A Case Study on Rubik's Cube},
  author = {Chongshan Fan and Shenghai Yuan},
  journal= {arXiv preprint arXiv:2507.05607},
  year   = {2025}
}