中文

CLTP:面向 3D 接触几何理解的对比语言-触觉预训练

机器人学 2025-05-14 v1

摘要

近期将触觉感知与视觉-语言模型(VLM)集成的进展显示出巨大的潜力,但现有触觉描述局限于纹理等浅层属性,忽略了机器人操作中至关重要的接触状态。为填补这一差距,我们提出 CLTP(Contrastive Language-Tactile Pre-training),一种直观且有效的语言触觉预训练框架,用于对齐触觉 3D 点云与各种接触场景下的自然语言,从而实现面向接触状态的触觉语言理解,以支持接触丰富的操控任务。我们首先收集了 50k+ 触觉 3D 点云-语言对数据集,其中描述显式捕获来自触觉传感器视角的多维接触状态(如接触位置、形状和力度)。CLTP 利用预对齐且冻结的视觉-语言特征空间桥接整体文本和触觉模态。实验验证了其在三个下游任务中的优势:零样 3D 分类、接触状态分类和触觉 3D 大语言模型(LLM)交互。迄今为止,这是首个从接触状态视角对齐触觉和语言表示以为操控任务提供潜力的研究。代码和数据集已开源于 https://sites.google.com/view/cltp/。

关键词

引用

@article{arxiv.2505.08194,
  title  = {CLTP: Contrastive Language-Tactile Pre-training for 3D Contact Geometry Understanding},
  author = {Wenxuan Ma and Xiaoge Cao and Yixiang Zhang and Chaofan Zhang and Shaobo Yang and Peng Hao and Bin Fang and Yinghao Cai and Shaowei Cui and Shuo Wang},
  journal= {arXiv preprint arXiv:2505.08194},
  year   = {2025}
}

备注

16 pages