中文

面向具身交互的通用视触觉视频理解

计算机视觉与模式识别 2025-05-29 v1 人工智能

摘要

触觉感知对于具身智能体理解仅凭视觉检查无法确定的物体物理属性至关重要。尽管现有方法在用于物理理解的视觉和语言模态方面取得了进展,但它们未能有效整合为真实世界交互提供关键触觉反馈的触觉信息。在本文中,我们提出了 VTV-LLM,这是首个用于通用视触觉视频(VTV)理解的多模态大语言模型,它弥合了触觉感知与自然语言之间的鸿沟。为了应对跨传感器和跨模态整合的挑战,我们贡献了 VTV150K,这是一个综合数据集,包含来自 100 个不同物体的 150,000 个视频帧,这些视频帧通过三种不同的触觉传感器(GelSight Mini、DIGIT 和 Tac3D)捕获,并标注了四种基本触觉属性(硬度、凸起、弹性和摩擦力)。我们开发了一种新颖的三阶段训练范式,包括用于稳健视触觉表征的 VTV 增强、用于跨模态对应的 VTV-文本对齐,以及用于自然语言生成的文本提示微调。我们的框架实现了复杂的触觉推理能力,包括特征评估、比较分析、基于场景的决策等。实验评估表明,VTV-LLM 在触觉视频理解任务中取得了卓越的性能,为触觉领域中更直观的人机交互奠定了基础。

关键词

引用

@article{arxiv.2505.22566,
  title  = {Universal Visuo-Tactile Video Understanding for Embodied Interaction},
  author = {Yifan Xie and Mingyang Li and Shoujie Li and Xingting Li and Guangyu Chen and Fei Ma and Fei Richard Yu and Wenbo Ding},
  journal= {arXiv preprint arXiv:2505.22566},
  year   = {2025}
}

备注

13 pages, 5 figures