CLIP-Fields:用于机器人记忆的弱监督语义场
机器人学
2024-11-20 v3 计算机视觉与模式识别
摘要
我们提出CLIP-Fields,一种可用于多种任务的隐式场景模型,例如分割、实例识别、空间语义搜索和视角定位。CLIP-Fields学习从空间位置到语义嵌入向量的映射。重要的是,我们表明该映射可仅由来自网络图像与网络文本训练的模型(如CLIP、Detic和Sentence-BERT)的监督训练得到,因此无需直接的人类监督。与Mask-RCNN等基线相比,我们的方法在HM3D数据集上仅用少量样本即在少样本实例识别或语义分割上表现更优。最后,我们展示将CLIP-Fields用作场景记忆,机器人可在真实环境中执行语义导航。我们的代码与演示视频可在此获取:https://mahis.life/clip-fields
引用
@article{arxiv.2210.05663,
title = {CLIP-Fields: Weakly Supervised Semantic Fields for Robotic Memory},
author = {Nur Muhammad Mahi Shafiullah and Chris Paxton and Lerrel Pinto and Soumith Chintala and Arthur Szlam},
journal= {arXiv preprint arXiv:2210.05663},
year = {2024}
}
备注
Code, video, and interactive demonstrations available at https://mahis.life/clip-fields. Accepted for publication at Robotics: Science and Systems 2023 in Daegu, Korea