机器人中的视觉-语言-动作:数据集、基准与数据引擎综述
机器人学
2026-04-28 v1 人工智能
摘要
尽管在视觉-语言-动作(VLA)模型方面取得了显著进展,但仍有一个核心瓶颈未得到充分考察:支撑具身学习的数据基础设施。本综述我们认为,VLA 的未来进展更依赖于高保真数据引擎和结构化评估协议的协同设计,而非模型架构。为此,我们系统、数据中心地分析了 VLA 研究,围绕三个支柱:数据集、基准和数据引擎。对于数据集,我们沿着具身多样性、模态组成和动作空间表述对真实数据集和合成数据集进行分类,揭示了持久的保真度-成本权衡从根本上限制了大规模收集。对于基准,我们联合分析任务复杂性和环境结构,暴露了在组合化泛化和长期推理评估方面现有协议存在的结构性差距。对于数据引擎,我们检阅仿真基准、视频重建和自动任务生成范式,识别出其在物理 grounding 和仿真到现实转移方面的共同局限。综合这些分析,我们提炼出四个开放性挑战:表示对齐、多模态监督、推理评估和可扩展数据生成。我们认为,要解决这些问题,必须将数据基础设施视为首要的研究问题,而非背景性关切。
引用
@article{arxiv.2604.23001,
title = {Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines},
author = {Ziyao Wang and Bingying Wang and Hanrong Zhang and Tingting Du and Tianyang Chen and Guoheng Sun and Yexiao He and Zheyu Shen and Wanghao Ye and Ang Li},
journal= {arXiv preprint arXiv:2604.23001},
year = {2026}
}
备注
This is a survey paper. The survey is already accepted by TMLR after peer-review. The OpenReview link is here: https://openreview.net/forum?id=tAaWFpvnmm