中文

AT-VLA: 面向增强触觉反馈的自适应触觉注入

机器人学 2026-05-19 v2

摘要

视觉-语言-动作(VLA)模型已显著提升了机器人代理在执行多样任务方面的能力; 然而, 它们仍面临接触丰富操控情景的挑战, 这些情景需要精确的物理交互。为解决这一限制, 最近的研究尝试在下游任务中引入触觉信号, 以使预训练的VLA能够解释触觉反馈。然而, 在微调阶段引入稀缺于预训练阶段的新模态, 可能会干扰VLA的预训练能力。此外, VLA固有的低推理速度会阻碍实时响应, 并限制了有效利用触觉反馈进行动作调整的潜力。为克服这些挑战, 本文提出自适应触觉视觉-语言-动作(AT-VLA), 引入一种新的自适应触觉注入机制。该机制动态确定触觉注入的合适时机和位置, 仅在触觉对动作生成有显著贡献时才进行注入, 从而最大限地减少对预训练表征的干扰。此外, 为实现快速精准的触觉响应, 本文提出触觉反馈双流机制, 将感知处理解耦为低频率的视觉-语言流用于感知推理, 和高频率的触觉控制流用于物理交互理解, 实现0.04秒内的实时闭环响应。真实世界的实验充分验证了AT-VLA在接触丰富操控任务中的有效性。项目页面可在https://sites.google.com/view/at-vla查看。

关键词

引用

@article{arxiv.2605.07308,
  title  = {AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models},
  author = {Xiaoqi Li and Muhe Cai and Jiadong Xu and Juan Zhu and Hongwei Fan and Yan Shen and Guangrui Ren and Hao Dong},
  journal= {arXiv preprint arXiv:2605.07308},
  year   = {2026}
}