中文

面向具身操作的视觉-语言-动作模型综述

机器人学 2025-11-13 v2 人工智能

摘要

具身智能系统通过持续的环境交互增强智能体能力,已引起学术界和工业界的广泛关注。受大型基础模型进展的启发,视觉-语言-动作(VLA)模型作为通用机器人控制框架,显著提升了具身智能系统中智能体与环境的交互能力。这一扩展拓宽了具身 AI 机器人的应用场景。本综述全面回顾了面向具身操作的 VLA 模型。首先,它记录了 VLA 架构的发展轨迹。随后,我们从 5 个关键维度对当前研究进行了详细分析:VLA 模型结构、训练数据集、预训练方法、后训练方法以及模型评估。最后,我们总结了 VLA 开发和实际部署中的关键挑战,并概述了有前景的未来研究方向。

关键词

引用

@article{arxiv.2508.15201,
  title  = {Survey of Vision-Language-Action Models for Embodied Manipulation},
  author = {Haoran Li and Yuhui Chen and Wenbo Cui and Weiheng Liu and Kai Liu and Mingcai Zhou and Zhengtao Zhang and Dongbin Zhao},
  journal= {arXiv preprint arXiv:2508.15201},
  year   = {2025}
}

备注

in Chinese language