中文

从观察到行动:基于潜在动作的工业场景VLA预训练中的原始段落分割

计算机视觉与模式识别 2026-03-31 v2 人工智能 机器人学

摘要

我们提出了一种新型无监督框架,用于从连续工业视频流中解锁大量无标签的人类演示数据,以用于视觉-语言-动作(Vision-Language-Action, VLA)模型的预训练。我们的框架首先训练一个轻量级运动标记器来编码运动动力学,然后采用一种基于新颖“潜在动作能量”度量的无监督动作分割器来发现和分割语义连贯的动作原始段落。该流程输出分割后的视频剪辑及其对应的潜在动作序列,提供直接适用于VLA预训练的结构化数据。评估在公共基准数据集和一个专有的电动机装配数据集上进行,证明能够有效分割人类在工作站上执行的关键任务。进一步的聚类和定量评估通过视觉-语言模型确认了所发现动作原始段落的语义连贯性。就我们所知,这是首个从非结构化工业视频中提取并组织VLA预训练数据的全自动端到端系统,为制造业中的具身人工智能集成提供了可扩展解决方案。

关键词

引用

@article{arxiv.2511.21428,
  title  = {From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings},
  author = {Jiajie Zhang and Sören Schwertfeger and Alexander Kleiner},
  journal= {arXiv preprint arXiv:2511.21428},
  year   = {2026}
}

备注

10 pages, 5 figures, Accepted to CVPR 2026