中文

将触觉绑定到一切:学习统一的多模态触觉表征

计算机视觉与模式识别 2024-02-01 v1 机器人学

摘要

将触觉与其他模态关联起来的能力对人类和计算系统具有重大意义。然而,由于数据采集过程昂贵且传感器输出非标准化,触觉的多模态学习仍然具有挑战性。我们引入了 UniTouch,这是一个统一的触觉模型,适用于基于视觉的触觉传感器,并连接到多种模态,包括视觉、语言和声音。我们通过将 UniTouch 嵌入与已关联多种其他模态的预训练图像嵌入对齐来实现这一点。我们进一步提出了可学习的传感器特定令牌,使模型能够同时从一组异构触觉传感器中学习。UniTouch 能够在零样本设置下执行各种触觉感知任务,从机器人抓取预测到触觉图像问答。据我们所知,UniTouch 是首个展示此类能力的模型。项目页面:https://cfeng16.github.io/UniTouch/

关键词

引用

@article{arxiv.2401.18084,
  title  = {Binding Touch to Everything: Learning Unified Multimodal Tactile Representations},
  author = {Fengyu Yang and Chao Feng and Ziyang Chen and Hyoungseob Park and Daniel Wang and Yiming Dou and Ziyao Zeng and Xien Chen and Rit Gangopadhyay and Andrew Owens and Alex Wong},
  journal= {arXiv preprint arXiv:2401.18084},
  year   = {2024}
}