中文

CLIPUNetr:以 CLIP 驱动的指示表达分割辅助非标定视觉伺服控制的人机接口

机器人学 2023-09-19 v1 计算机视觉与模式识别

摘要

非标定基于图像的视觉伺服(UIBVS)中经典的人机接口依赖于人工标注或带类别标签的语义分割。这两种方法均无法像自然语言表达式那样匹配人类自然交流,并在操作任务中有效传达丰富语义。本文通过使用指示表达分割(一种基于提示的方法)为机器人感知提供更深入的信息来解决该问题。为从指示表达生成高质量分割预测,我们提出 CLIPUNetr——一种新颖的 CLIP 驱动指示表达分割网络。CLIPUNetr 利用 CLIP 强大的视觉-语言表示来从指示表达中分割区域,同时利用其“U 形”编码器-解码器架构生成具有更锐利边界与更精细结构的预测。此外,我们提出一种新流程将 CLIPUNetr 集成到 UIBVS 中,并应用于真实环境中机器人控制。实验中,我们的方法在边界与结构度量上平均提升 120%,并能在非结构化操作环境中成功辅助真实世界 UIBVS 控制。

关键词

引用

@article{arxiv.2309.09183,
  title  = {CLIPUNetr: Assisting Human-robot Interface for Uncalibrated Visual Servoing Control with CLIP-driven Referring Expression Segmentation},
  author = {Chen Jiang and Yuchen Yang and Martin Jagersand},
  journal= {arXiv preprint arXiv:2309.09183},
  year   = {2023}
}