深度门控多模态学习:利用触觉与图像数据进行手中物体位姿变化估计
机器人学
2020-08-04 v3
摘要
对于手中操作,估计手中物体的位姿是将物体操控至目标位姿的重要功能之一。由于手中操作易因手或物体自身造成遮挡,仅图像信息不足以进行手中物体位姿估计。此时可使用多种模态,其优势在于其他模态可补偿遮挡、噪声与传感器故障。尽管针对相应情形决定模态利用率(称为可靠度值)十分重要,但此类模型的手动设计困难,尤其对于多样情形。本文提出深度门控多模态学习,通过端到端深度学习自行确定各模态的可靠度值。实验中,将RGB相机与GelSight触觉传感器安装于Sawyer机器人的平行夹爪上,并在抓取过程中估计物体位姿变化。实验共使用15个物体。在所提模型中,根据各模态的噪声水平与失效情况确定其可靠度值,并确认即便对未知物体也能估计位姿变化。
引用
@article{arxiv.1909.12494,
title = {Deep Gated Multi-modal Learning: In-hand Object Pose Changes Estimation using Tactile and Image Data},
author = {Tomoki Anzai and Kuniyuki Takahashi},
journal= {arXiv preprint arXiv:1909.12494},
year = {2020}
}
备注
8 pages. Accepted to IROS 2020. An accompanying video is available at https://youtu.be/2OPQxQIcSxY