OmniVTLA:具有语义对齐触觉感知的视觉-触觉-语言-动作模型
机器人学
2025-08-25 v2
摘要
最近的视觉-语言-动作(VLA)模型建立在视觉-语言基础之上,在机器人操作中取得了有希望的结果,并展示了任务泛化的可能性。然而,由于触觉传感器的异质性和获取触觉数据的困难,当前的 VLA 模型严重忽视了触觉感知的重要性,并在接触密集型任务中失败。为了解决这个问题,本文提出了 OmniVTLA,一种涉及触觉感知的新型架构。具体来说,我们的贡献有三方面。首先,我们的 OmniVTLA 具有双路径触觉编码器框架。该框架通过使用预训练的视觉变换器(ViT)和语义对齐的触觉 ViT(SA-ViT),增强了跨不同基于视觉和基于力的触觉传感器的触觉感知。其次,我们引入了 ObjTac,一个全面的基于力的触觉数据集,捕获了 10 个类别中 56 个物体的文本、视觉和触觉信息。ObjTac 拥有 135K 个三模态样本,补充了现有的视觉-触觉数据集。第三,利用这个数据集,我们训练了一个语义对齐的触觉编码器,以学习统一的触觉表示,作为 OmniVTLA 的更好初始化。真实世界实验表明,与最先进的 VLA 基线相比,性能有显著提升,在拾取和放置任务中,使用夹爪的成功率达到 96.9%(比基线高 21.9%),使用灵巧手的成功率达到 100%(比基线高 6.2%)。此外,与现有的 VLA 相比,OmniVTLA 通过触觉感知显著减少了任务完成时间并生成了更平滑的轨迹。我们的 ObjTac 数据集可在 https://readerek.github.io/Objtac.github.io 找到。
引用
@article{arxiv.2508.08706,
title = {OmniVTLA: Vision-Tactile-Language-Action Model with Semantic-Aligned Tactile Sensing},
author = {Zhengxue Cheng and Yiqian Zhang and Wenkang Zhang and Haoyu Li and Keyu Wang and Li Song and Hengdi Zhang},
journal= {arXiv preprint arXiv:2508.08706},
year = {2025}
}
备注
15 pages, 7 figures, 8 tables. ObjTac dataset: https://readerek.github.io/Objtac.github.io