中文

学习感知未来:用于富接触操作的 DreamTacVLA

机器人学 2026-05-07 v3 计算机视觉与模式识别

摘要

视觉-语言-动作(VLA)模型通过将网络级知识映射到机器人控制展现了卓越的泛化能力,但它们对物理接触仍然“盲目”。因此,它们在需要推理力、纹理和滑动的富接触操作任务中表现挣扎。虽然一些方法结合了低维触觉信号,但它们无法捕捉此类交互所必需的高分辨率动力学。为了解决这一局限性,我们引入了 DreamTacVLA,这是一个通过学习感知未来将 VLA 模型扎根于接触物理的框架。我们的模型采用分层感知方案,其中高分辨率触觉图像作为微观视觉输入,与腕部相机局部视觉和第三人称宏观视觉相耦合。为了协调这些多尺度感官流,我们首先使用分层空间对齐(HSA)损失训练统一策略,该损失将触觉 token 与其在腕部和第三人称视图中的空间对应物对齐。为了进一步加深模型对细粒度接触动力学的理解,我们使用预测未来触觉信号的触觉世界模型对系统进行微调。为了缓解触觉数据稀缺和触觉传感器易磨损的特性,我们构建了一个混合大规模数据集,其数据来源于高保真数字孪生和真实世界实验。通过预测即将到来的触觉状态,DreamTacVLA 获得了丰富的接触物理模型,并基于真实观察和想象中的后果来调节其动作。在富接触操作任务中,它优于最先进的 VLA 基线,实现了高达 95% 的成功率,突显了理解物理接触对于稳健、触觉感知的机器人代理的重要性。

关键词

引用

@article{arxiv.2512.23864,
  title  = {Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation},
  author = {Guo Ye and Zexi Zhang and Xu Zhao and Shang Wu and Haoran Lu and Shihan Lu and Han Liu},
  journal= {arXiv preprint arXiv:2512.23864},
  year   = {2026}
}