Touch100k: 一个面向触觉中心多模态表征的大规模触觉-语言-视觉数据集
机器人学
2024-06-07 v1
摘要
触觉在增强人类和机器人的感知与交互能力方面具有关键地位。尽管其重要性,当前的触觉研究主要集中在视觉和触觉模态上,忽略了语言领域。受此启发,我们构建了Touch100k,一个规模为10万的配对触觉-语言-视觉数据集,包含多粒度的触觉感觉描述(即具有丰富语义的句子级自然表达,包括上下文和动态关系,以及描述触觉感觉关键特征的短语级描述)。基于该数据集,我们提出了一种预训练方法,即通过课程链接进行触觉-语言-视觉表征学习(简称TLV-Link),其灵感来源于课程学习的概念。TLV-Link旨在学习GelSight传感器的触觉表征,并捕捉触觉、语言和视觉模态之间的关系。我们评估了我们的表征在两个任务类别(即材料属性识别和机器人抓取预测)上的性能,重点关注触觉表征和零样本触觉理解。实验评估展示了我们表征的有效性。通过使TLV-Link实现实质性改进并建立触觉中心多模态表征学习的新最先进水平,Touch100k证明了其作为有价值研究资源的地位。项目页面:https://cocacola-lab.github.io/Touch100k/。
引用
@article{arxiv.2406.03813,
title = {Touch100k: A Large-Scale Touch-Language-Vision Dataset for Touch-Centric Multimodal Representation},
author = {Ning Cheng and Changhao Guan and Jing Gao and Weihao Wang and You Li and Fandong Meng and Jie Zhou and Bin Fang and Jinan Xu and Wenjuan Han},
journal= {arXiv preprint arXiv:2406.03813},
year = {2024}
}