面向实际应用的机器人视觉-语言-动作模型综述
机器人学
2025-10-09 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
在越来越多的研究者致力于利用大语言模型(LLM)和视觉语言模型(VLM)应用于机器人领域之际,视觉-语言-动作(Vision-Language-Action, VLA)模型近年来受到广泛关注。通过在大规模数据中统一视觉、语言和动作数据,而这些数据过去一直是分别研究的,VLA 模型旨在学习能够在各种任务、物体、本体化方式和环境中通用化的政策。这种通用化能力预计将使机器人能够以最小或无需额外任务特定数据的情况下解决新出现的下游任务,从而实现更灵活和可扩展的实际部署。与之前专注于动作表示或高层模型架构的调查不同,本工作提供了一项全栈综述,集成了 VLA 系统中软件和硬件组件。具体而言,本文对 VLAs 进行了系统性综述,涵盖其策略和架构演变、架构和构建模块、模态特定处理技术以及学习范式。此外,为支持 VLAs 在实际机器人应用中的部署,我们还综述了常用的机器人平台、数据收集策略、公开数据集、数据增强方法以及评估基准。 throughout this comprehensive survey, 本文旨在为机器人社区在实际机器人系统中应用 VLAs 提供实用指导。所有按训练方法、评估方法、模态和数据集分类的参考文献,均可在我们项目网站上的表格中查阅:https://vla-survey.github.io。
引用
@article{arxiv.2510.07077,
title = {Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications},
author = {Kento Kawaharazuka and Jihoon Oh and Jun Yamada and Ingmar Posner and Yuke Zhu},
journal= {arXiv preprint arXiv:2510.07077},
year = {2025}
}
备注
Accepted to IEEE Access, website: https://vla-survey.github.io