中文

深度门控多模态学习:利用触觉与图像数据进行手中物体位姿变化估计

机器人学 2020-08-04 v3

摘要

对于手中操作,估计手中物体的位姿是将物体操控至目标位姿的重要功能之一。由于手中操作易因手或物体自身造成遮挡,仅图像信息不足以进行手中物体位姿估计。此时可使用多种模态,其优势在于其他模态可补偿遮挡、噪声与传感器故障。尽管针对相应情形决定模态利用率(称为可靠度值)十分重要,但此类模型的手动设计困难,尤其对于多样情形。本文提出深度门控多模态学习,通过端到端深度学习自行确定各模态的可靠度值。实验中,将RGB相机与GelSight触觉传感器安装于Sawyer机器人的平行夹爪上,并在抓取过程中估计物体位姿变化。实验共使用15个物体。在所提模型中,根据各模态的噪声水平与失效情况确定其可靠度值,并确认即便对未知物体也能估计位姿变化。

关键词

引用

@article{arxiv.1909.12494,
  title  = {Deep Gated Multi-modal Learning: In-hand Object Pose Changes Estimation using Tactile and Image Data},
  author = {Tomoki Anzai and Kuniyuki Takahashi},
  journal= {arXiv preprint arXiv:1909.12494},
  year   = {2020}
}

备注

8 pages. Accepted to IROS 2020. An accompanying video is available at https://youtu.be/2OPQxQIcSxY