中文

LARY: 一个用于可泛化视觉-动作对齐的潜在动作表示基准

计算机视觉与模式识别 2026-04-14 v1 机器人学

摘要

虽然显式动作数据的短缺限制了视觉-语言-动作(VLA)模型,但人类动作视频提供了一个可扩展但未标记的数据源。利用大规模人类视频数据集的一个关键挑战在于将视觉信号转换为与本体无关的表示,即潜在动作。然而,潜在动作表示从视觉观察中推导鲁棒控制的能力尚未得到严格评估。我们引入了潜在动作表示生成(LARY)基准,这是一个统一的框架,用于评估潜在动作表示在高层次语义动作(做什么)和低层次机器人控制(怎么做)上的表现。该精心策划的数据集包含超过一百万段视频(1000小时),涵盖151个动作类别,以及跨越不同具身和环境的62万图像对和59.5万运动轨迹。我们的实验揭示了两个关键见解:(i) 未经过任何动作监督训练的通用视觉基础模型,始终优于专门化的具身潜在动作模型。(ii) 基于潜在空间的视觉空间从根本上比基于像素的空间更适应物理动作空间。这些结果表明,通用视觉表示内在地编码了用于物理控制的动作相关知识,并且语义级别的抽象是从视觉到动作比像素级重建更根本的有效途径。

关键词

引用

@article{arxiv.2604.11689,
  title  = {LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment},
  author = {Dujun Nie and Fengjiao Chen and Qi Lv and Jun Kuang and Xiaoyu Li and Xuezhi Cao and Xunliang Cai},
  journal= {arXiv preprint arXiv:2604.11689},
  year   = {2026}
}

备注

Project: https://meituan-longcat.github.io/LARYBench Code: https://github.com/meituan-longcat/LARYBench Dataset: https://huggingface.co/datasets/meituan-longcat/LARYBench