CubeRobot:通过视觉-语言模型将语言落地于魔方操作
机器人学
2025-03-26 v1 人工智能
摘要
在高层级证明魔方定理代表了人类空间想象与逻辑思维推理能力的一个显著里程碑.传统的魔方机器人依赖复杂的视觉系统和固定算法,往往难以适应复杂多变的动态场景.为克服这一局限,我们提出了 CubeRobot,一种专为求解 3x3 魔方而定制的视觉-语言模型(VLM),赋予具身智能体多模态理解与执行能力.我们使用了 CubeCoT 图像数据集,其中包含人类无法处理的多层级任务(共 43 个子任务),涵盖了各种魔方状态.我们融合了双循环 VisionCoT 架构与 Memory Stream,后者是一种从 VLM 生成的规划查询中提取任务相关特征的范式,从而使 CubeRobot 能够独立进行规划、决策与反思,并对高层级和低层级的魔方任务进行分别管理.此外,在低层级魔方复原任务中,CubeRobot 达到了 100% 的高准确率,中层级任务同样接近 100%,在高层级任务中达到了 80% 的准确率.
引用
@article{arxiv.2503.19281,
title = {CubeRobot: Grounding Language in Rubik's Cube Manipulation via Vision-Language Model},
author = {Feiyang Wang and Xiaomin Yu and Wangyu Wu},
journal= {arXiv preprint arXiv:2503.19281},
year = {2025}
}