中文

基于标注引导视觉提示与 ACT 的机器人操作抓取与放置

机器人学 2025-08-13 v1 人工智能

摘要

便利店中的机器人抓取与放置任务因物体密集排列、遮挡以及颜色、形状、尺寸和纹理等物体属性的变化而面临挑战。这些因素使轨迹规划和抓取变得复杂。本文介绍了一种利用标注引导视觉提示的感知-行动流程,其中边界框标注同时识别可抓取物体和放置位置,提供结构化的空间引导。我们摒弃传统的逐步规划,采用基于 Transformer 的动作分块(ACT)作为模仿学习算法,使机器人手臂能够从人类演示中预测分块的动作序列。这有助于实现平滑、自适应且数据驱动的抓取与放置操作。我们基于成功率和抓取行为的可视化分析评估了我们的系统,证明了在零售环境中抓取准确性和适应性的提升。

关键词

引用

@article{arxiv.2508.08748,
  title  = {Visual Prompting for Robotic Manipulation with Annotation-Guided Pick-and-Place Using ACT},
  author = {Muhammad A. Muttaqien and Tomohiro Motoda and Ryo Hanai and Yukiyasu Domae},
  journal= {arXiv preprint arXiv:2508.08748},
  year   = {2025}
}