中文

拾放任务中的场景理解:分析初始与最终场景间的变换

计算机视觉与模式识别 2024-09-27 v1 机器人学 系统与控制 系统与控制

摘要

随着机器人在日常任务中与人类的协作日益增多,朝着能够理解环境的机器人系统迈出步伐至关重要。本工作聚焦于场景理解,以根据场景的初始和最终图像检测拾放任务。为此,我们收集了一个用于目标检测和拾放任务检测的数据集。随后训练了一个 YOLOv5 网络来检测初始和最终场景中的物体。给定检测到的物体及其边界框,我们提出了两种方法来检测将初始场景转变为最终场景的拾放任务。提出了一种几何方法,该方法跟踪物体在两个场景中的移动,并基于在场景内移动的边界框的交集进行工作。相比之下,基于 CNN 的方法利用卷积神经网络将具有相交边界框的物体分类为 5 个类别,以显示所涉及物体之间的空间关系。然后,通过分析两个场景的实验结果推导出所执行的拾放任务。结果表明,使用 VGG16 骨干的基于 CNN 的方法在某些场景下比几何方法高出约 12 个百分点,总体成功率达到 84.3%。

关键词

引用

@article{arxiv.2409.17720,
  title  = {Scene Understanding in Pick-and-Place Tasks: Analyzing Transformations Between Initial and Final Scenes},
  author = {Seraj Ghasemi and Hamed Hosseini and MohammadHossein Koosheshi and Mehdi Tale Masouleh and Ahmad Kalhor},
  journal= {arXiv preprint arXiv:2409.17720},
  year   = {2024}
}

备注

Conference Paper, ICEE 2024, 7 pages, 5 figures