Sparsh:面向视觉触觉传感器的自监督触觉表征
机器人学
2024-11-01 v1
摘要
本文介绍了一种通用的触觉表征方法,针对日益普及的视觉触觉传感器。这些传感器虽然推动了机器人操作的最新进展,但当前的解决方案往往依赖于特定任务和传感器的手工制作感知模型。大规模收集带有接触力和滑移等任务导向标签的真实数据,受传感器形态、照明和凝胶标记等差异的制约。为此,我们采用在计算机视觉中展现卓越性能的自监督学习(SSL)方法。我们提出Sparsh,一套可支持多种视觉触觉传感器的SSL模型,通过在46万余张触觉图像上进行掩码和自蒸馏(在像素级和潜在空间),以消除对自定义标签的依赖。我们还构建了TacBench,以便在传感器和模型之间进行标准化基准测试,包含六个任务:从理解触觉属性到实现物理感知和操作规划。评估结果表明,针对触觉表征的SSL预训练在TacBench上平均优于特定任务和传感器的端到端训练95.1%,其中Sparsh(DINO)和Sparsh(IJEPA)最具竞争力,表明在潜在空间学习触觉图像具有优势。项目页面:https://sparsh-ssl.github.io/
引用
@article{arxiv.2410.24090,
title = {Sparsh: Self-supervised touch representations for vision-based tactile sensing},
author = {Carolina Higuera and Akash Sharma and Chaithanya Krishna Bodduluri and Taosha Fan and Patrick Lancaster and Mrinal Kalakrishnan and Michael Kaess and Byron Boots and Mike Lambeta and Tingfan Wu and Mustafa Mukadam},
journal= {arXiv preprint arXiv:2410.24090},
year = {2024}
}
备注
Conference on Robot Learning (CoRL), 2024