面向具身操作的视觉-语言-动作模型综述
机器人学
2025-11-13 v2 人工智能
摘要
具身智能系统通过持续的环境交互增强智能体能力,已引起学术界和工业界的广泛关注。受大型基础模型进展的启发,视觉-语言-动作(VLA)模型作为通用机器人控制框架,显著提升了具身智能系统中智能体与环境的交互能力。这一扩展拓宽了具身 AI 机器人的应用场景。本综述全面回顾了面向具身操作的 VLA 模型。首先,它记录了 VLA 架构的发展轨迹。随后,我们从 5 个关键维度对当前研究进行了详细分析:VLA 模型结构、训练数据集、预训练方法、后训练方法以及模型评估。最后,我们总结了 VLA 开发和实际部署中的关键挑战,并概述了有前景的未来研究方向。
引用
@article{arxiv.2508.15201,
title = {Survey of Vision-Language-Action Models for Embodied Manipulation},
author = {Haoran Li and Yuhui Chen and Wenbo Cui and Weiheng Liu and Kai Liu and Mingcai Zhou and Zhengtao Zhang and Dongbin Zhao},
journal= {arXiv preprint arXiv:2508.15201},
year = {2025}
}
备注
in Chinese language