VitaTouch:面向制造业机器人质量检测的属性感知视觉-触觉-语言模型
计算机视觉与模式识别
2026-04-07 v1 人工智能
机器人学
摘要
智能制造中的质量检测需要识别超出可见几何形状的内在材料和表面属性,然而纯视觉方法仍然容易受到遮挡和反射的影响。我们提出了 VitaTouch,一个用于材料属性推断和自然语言属性描述的属性感知视觉-触觉-语言模型。VitaTouch 使用模态特定的编码器和一个双 Q-Former 来提取与语言相关的视觉和触觉特征,这些特征被压缩成前缀令牌供大型语言模型使用。我们将每种模态与文本对齐,并通过对比学习显式耦合视觉和触觉。我们还构建了 VitaSet,一个包含 186 个物体、52k 张图像和 5.1k 条人工验证的指令-答案对的多模态数据集。VitaTouch 在 HCT 和整体 TVL 基准测试上取得了最佳性能,同时在 SSVTP 上保持竞争力。在 VitaSet 上,它达到了 88.89% 的硬度准确率、75.13% 的粗糙度准确率和 54.81% 的描述符召回率;材料描述任务进一步达到了 0.9009 的峰值语义相似度。通过基于 LoRA 的微调,VitaTouch 在 2 类、3 类和 5 类缺陷识别上分别达到了 100.0%、96.0% 和 92.0% 的准确率,并在 100 次实验室机器人试验中实现了 94.0% 的闭环识别准确率和 94.0% 的端到端分拣成功率。更多细节请访问项目页面:https://vitatouch.github.io/
引用
@article{arxiv.2604.03322,
title = {VitaTouch: Property-Aware Vision-Tactile-Language Model for Robotic Quality Inspection in Manufacturing},
author = {Junyi Zong and Qingxuan Jia and Meixian Shi and Tong Li and Jiayuan Li and Zihang Lv and Gang Chen and Fang Deng},
journal= {arXiv preprint arXiv:2604.03322},
year = {2026}
}
备注
11 pages, 6 figures