TacVLA:面向稳健视觉-语言-动作操作的触觉感知融合
机器人学
2026-03-26 v2
摘要
视觉-语言-动作(VLA)模型在机器人操作中展现出显著优势,但依赖视觉与语言输入,往往导致在视觉遮挡、细粒度操作和物理接触任务中表现不佳。为此,我们提出了 TacVLA,通过将触觉模态纳入基于变换器的策略模型以增强细粒度操作能力。具体而言,我们引入了接触感知门控机制,仅在检测到接触时激活触觉 token,从而实现自适应多模态融合,同时避免无关触觉干扰。融合后的视觉、语言和触觉 token 在变换器架构中联合处理,以强化接触丰富交互期间的跨模态对齐。针对约束锁定拆卸、盒内抓取及鲁棒性评估等多个任务进行大规模实验,结果表明我们的方法在各项指标上均优于基线模型,拆卸成功率提升约 20%,盒内抓取提升约 60%,在视觉遮挡场景下性能提升约 2.1 倍。视频已公开于 https://sites.google.com/view/tacvla,代码亦将在发布后开源。
引用
@article{arxiv.2603.12665,
title = {TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation},
author = {Kaidi Zhang and Heng Zhang and Zhengtong Xu and Zhiyuan Zhang and Md Rakibul Islam Prince and Xiang Li and Xiaojing Han and Yuhao Zhou and Arash Ajoudani and Yu She},
journal= {arXiv preprint arXiv:2603.12665},
year = {2026}
}
备注
9 pages, 7 figures