从人类指令到动作序列执行:基于机器人动作网络的 Instruct2Act
机器人学
2026-02-11 v1 人工智能
摘要
机器人往往难以在实际场景中遵循自由形式的人类指令,因为存在计算和感知限制。我们通过一个轻量级、完全本地的管道解决这一问题,将自然语言命令转换为可靠的操纵操作。我们的ethods 包含两个阶段:(i) 指令到动作模块(Instruct2Act),一个紧凑的 BiLSTM 带多头注意力自编码器,用于将指令解析为有序的原子动作序列(如到达、抓取、移动、放置);(ii) 机器人动作网络(RAN),其使用动态自适应轨迹径向网络(DATRN)以及基于视觉的环境分析器(YOLOv8)为每个子动作生成精确的控制轨迹。整个系统在一台配置有限的系统上运行,无需云端服务。在我们自建的专有数据集上,Instruct2Act 实现了 91.5% 的子动作预测准确率,同时保持较小的存储空间。实际机器人评估覆盖四项任务(pick-place、pick-pour、擦拭、pick-give),总体成功率达 90%;子动作推理耗时 < 3.8 秒,端到端执行时间在 30-60 秒之间,取决于任务复杂度。这些结果表明,细粒度的指令到动作解析,结合 DATRN 基于轨迹的生成和视觉导向的 grounding,为在资源受限、单摄像头设置下实现确定性、实时操纵提供了可行路径。
引用
@article{arxiv.2602.09940,
title = {Instruct2Act: From Human Instruction to Actions Sequencing and Execution via Robot Action Network for Robotic Manipulation},
author = {Archit Sharma and Dharmendra Sharma and John Rebeiro and Peeyush Thakur and Narendra Dhar and Laxmidhar Behera},
journal= {arXiv preprint arXiv:2602.09940},
year = {2026}
}