视觉-语言-动作模型剖析:从模块到里程碑与挑战
机器人学
2025-12-22 v3
摘要
视觉-语言-动作(VLA)模型正在推动机器人学的革命,使机器能够理解指令并与物理世界交互。该领域正以新模型和新数据集的爆发式增长令人兴奋,但也令人难以跟上步伐。本综述为 VLA 领域提供了一个清晰且结构化的指南。我们将其设计为遵循研究者的自然学习路径:从任何 VLA 模型的基本模块开始,追溯关键里程碑的历史,然后深入探讨定义近期研究前沿的核心挑战。我们的主要贡献是对五大挑战的详细分解:(1) 表示,(2) 执行,(3) 泛化,(4) 安全性,以及 (5) 数据集与评估。这一结构反映了一个通用智能体的发展路线图:建立基本的感知-动作循环,在多样化的具身形态和环境中扩展能力,最终确保可信部署——所有这些都由必要的数据基础设施支撑。针对每一项,我们回顾了现有方法并突出了未来机会。我们将本文定位为新人的基础指南和资深研究者的战略路线图,双重目标是加速学习和激发具身智能领域的新想法。本综述的实时版本将持续更新,维护在我们的项目页面上。
引用
@article{arxiv.2512.11362,
title = {An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges},
author = {Chao Xu and Suyu Zhang and Yang Liu and Baigui Sun and Weihong Chen and Bo Xu and Qi Liu and Juncheng Wang and Shujun Wang and Shan Luo and Jan Peters and Athanasios V. Vasilakos and Stefanos Zafeiriou and Jiankang Deng},
journal= {arXiv preprint arXiv:2512.11362},
year = {2025}
}
备注
project page: https://suyuz1.github.io/VLA-Survey-Anatomy/