中文

Joint-Aligned Latent Action:野生环境下可扩展 VLA 预训练的路径

机器人学 2026-02-26 v1

摘要

尽管取得了进展,视觉-语言-动作模型(VLA)仍受限于大规模、多样化机器人数据的匮乏。虽然人类操作视频提供了丰富的替代方案,但现有方法被迫在小型精确标注数据集和大规模野生环境 footage 之间做出选择,后者的手部跟踪标签不可靠。我们提出了 JALA,即一种学习联合对齐潜在动作的预训练框架。JALA 绕过完整的视觉动态重建,学习一种与反向动力学和真实动作对齐的预测动作嵌入。这产生一种具有过渡意识的、以行为为中心的潜在空间,用于从异构人类数据中学习。我们通过 UniHand-Mix 进行了规模化,该数据集包含超过 750 万个视频(>2000 小时),融合实验室和野生环境的 footage。实验表明,JALA 在受控和不受约束的场景中生成更真实的手部动作,显著提高了在仿真和真实世界任务中的下游机器人操作性能。这表明联合对齐潜在动作为从人类数据中进行 VLA 预训练提供了可扩展的路径。

关键词

引用

@article{arxiv.2602.21736,
  title  = {Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild},
  author = {Hao Luo and Ye Wang and Wanpeng Zhang and Haoqi Yuan and Yicheng Feng and Haiweng Xu and Sipeng Zheng and Zongqing Lu},
  journal= {arXiv preprint arXiv:2602.21736},
  year   = {2026}
}

备注

CVPR2026