ForceSight:基于视觉-力目标与文本引导的移动操纵
机器人学
2023-09-26 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
我们提出 ForceSight,一种通过深度神经网络预测视觉-力目标的文本引导移动操纵系统。给定单张 RGBD 图像与文本提示,ForceSight 确定相机坐标系下的目标末端执行器位姿(运动学目标)及关联力(力目标)。这两个部分共同构成视觉-力目标。已有工作表明,输出人类可解释运动学目标的深度模型可使真实机器人实现灵巧操纵。力对操纵至关重要,但在这些系统中通常被置于较低层执行。当部署于配备眼在手 RGBD 相机的移动操纵器上时,ForceSight 在未见环境中以与训练数据显著不同的物体实例完成了精确抓取、抽屉开启和物体交接等任务,成功率达 81%。在另一实验中,仅依赖视觉伺服而忽略力目标使成功率从 90% 降至 45%,表明力目标可显著提升性能。附录、视频、代码和训练好的模型可在 https://force-sight.github.io/ 获取。
引用
@article{arxiv.2309.12312,
title = {ForceSight: Text-Guided Mobile Manipulation with Visual-Force Goals},
author = {Jeremy A. Collins and Cody Houff and You Liang Tan and Charles C. Kemp},
journal= {arXiv preprint arXiv:2309.12312},
year = {2023}
}