MOSAIC:通过交互式感知学习用于机器人学习的统一多感官物体属性表示
机器人学
2024-02-26 v2
摘要
对跨越多种感官模态(例如视觉、听觉和触觉)的物体属性形成整体理解,对于从物体分类到复杂操控的任务至关重要。受认知科学研究强调多感官整合在人类感知中重要性的启发,我们提出了 MOSAIC(基于自注意力与交互式理解的多模态物体属性学习),一种旨在促进统一多感官物体属性表示学习的新框架。尽管视觉信息无疑起着突出作用,但我们认识到许多基本物体属性超越视觉领域,涵盖纹理、质量分布或声音等属性,这些属性显著影响我们与物体的交互方式。在 MOSAIC 中,我们利用这一深刻见解,从多模态基础模型中蒸馏知识,并将这些表示在视觉之外还与触觉和听觉感官模态对齐。通过在人形机器人以 10 种探索行为对 100 个物体进行交互的数据集上开展大量实验,我们展示了 MOSAIC 在两类任务族中的通用性:物体分类与取物任务。我们的结果凸显了 MOSAIC 统一表示的有效性,在简单线性探测设置下于类别识别中表现出有竞争力的性能,并在零样本迁移条件下于取物任务中表现优异。本工作开创了将感官接地应用于机器人基础模型的先河,有望使自主系统的多感官感知能力实现重大飞跃。我们已发布代码、数据集与额外结果:https://github.com/gtatiya/MOSAIC。
引用
@article{arxiv.2309.08508,
title = {MOSAIC: Learning Unified Multi-Sensory Object Property Representations for Robot Learning via Interactive Perception},
author = {Gyan Tatiya and Jonathan Francis and Ho-Hsiang Wu and Yonatan Bisk and Jivko Sinapov},
journal= {arXiv preprint arXiv:2309.08508},
year = {2024}
}
备注
Accepted to the 2024 IEEE International Conference on Robotics and Automation (ICRA), May 13 to 17, 2024; Yokohama, Japan