Manual2Skill:利用视觉语言模型学习阅读说明书并获取家具装配机器人技能
机器人学
2025-10-21 v3 人工智能
摘要
人类具备理解和执行复杂操作任务的惊人能力,通过解读抽象的指令手册。在机器人来看,这一能力仍然是一个重大的挑战,因为它们无法解释抽象指令并将其转化为可执行动作。在本文中,我们提出了Manual2Skill,一个 novel 框架,使机器人能够通过高级手动指令引导执行复杂装配任务。我们的methods 利用视觉语言模型(VLM)从说明书中的结构化信息中提取信息,然后使用该信息构建分层装配图。这些图表示部件、子组件及其之间的关系。为促进任务执行,姿态估计算预测每个装配步骤中组件的相对6D姿态。同时,运动规划模块生成用于实际世界机器人实现的可操作序列。我们通过成功装配多个真实世界的IKEA家具来证明了Manual2Skill的有效性。该应用凸显了其在效率和精度方面处理长期操作任务的能力,显著增强了机器人从指令手册学习的实用性。这一工作标志着机器人系统在类似人类能力方面理解和执行复杂操作任务的一步进步。项目页面:https://owensun2004.github.io/Furniture-Assembly-Web/
引用
@article{arxiv.2502.10090,
title = {Manual2Skill: Learning to Read Manuals and Acquire Robotic Skills for Furniture Assembly Using Vision-Language Models},
author = {Chenrui Tie and Shengxiang Sun and Jinxuan Zhu and Yiwei Liu and Jingxiang Guo and Yue Hu and Haonan Chen and Junting Chen and Ruihai Wu and Lin Shao},
journal= {arXiv preprint arXiv:2502.10090},
year = {2025}
}