用于多模态对齐的触觉、视觉与语言数据集
计算机视觉与模式识别
2024-02-21 v1 机器人学
摘要
触觉是人类重要的感知模态,但尚未被纳入多模态生成语言模型中。这部分是由于难以获取触觉数据的自然语言标签,以及将触觉读数与视觉观察和语言描述对齐的复杂性。作为弥合这一差距的一步,本工作引入了一个包含 44K 野外视觉 - 触觉对的新数据集,其中包含人工标注的英语标签(10%)和来自 GPT-4V 的文本伪标签(90%)。我们利用该数据集训练了一个用于开放词汇分类的视觉 - 语言对齐触觉编码器,以及一个使用该训练编码器进行文本生成的触觉 - 视觉 - 语言(TVL)模型。结果表明,通过引入触觉,TVL 模型在触觉 - 视觉 - 语言对齐方面比任何基于这些模态对训练的现有模型提高了 29% 的分类准确率。尽管数据集中只有一小部分是人工标注的,但在新的触觉 - 视觉理解基准上,TVL 模型展现出优于 GPT-4V(+12%)和开源视觉 - 语言模型(+32%)的视觉 - 触觉理解能力。代码和数据:https://tactile-vlm.github.io。
引用
@article{arxiv.2402.13232,
title = {A Touch, Vision, and Language Dataset for Multimodal Alignment},
author = {Letian Fu and Gaurav Datta and Huang Huang and William Chung-Ho Panitch and Jaimyn Drake and Joseph Ortiz and Mustafa Mukadam and Mike Lambeta and Roberto Calandra and Ken Goldberg},
journal= {arXiv preprint arXiv:2402.13232},
year = {2024}
}