从“What”和“Where”基础模型构建机器人用的预训练对象中心表示
机器人学
2024-04-23 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
近年来,针对机器人控制的视觉表示预训练以及对一般图像中未知类别对象的分割取得了显著进展。为充分利用这些技术以提高机器人学习效果,我们提出了POCR——一个用于构建机器人控制预训练对象中心表示的新框架。基于心理学和计算机视觉中的“what-where”表示理论,我们使用分割模型在不同时间步稳定定位场景中的各种实体,捕获“where”信息。然后将其他预训练模型应用于每个分割实体,以构建适用于机器人控制任务的向量描述,因而捕获“what”该实体是。因此,我们的预训练对象中心表示是通过合理组合即插即用预训练模型的输出而构建的,无需额外训练。在各种模拟和实际机器人任务上,我们展示了在POCR上训练的仿生策略相较于机器人领域的最新预训练表示以及通常从头训练的先前对象中心表示,实现了更好的性能和系统性推广。
关键词
引用
@article{arxiv.2404.13474,
title = {Composing Pre-Trained Object-Centric Representations for Robotics From "What" and "Where" Foundation Models},
author = {Junyao Shi and Jianing Qian and Yecheng Jason Ma and Dinesh Jayaraman},
journal= {arXiv preprint arXiv:2404.13474},
year = {2024}
}
备注
ICRA 2024. Project website: https://sites.google.com/view/pocr