从感知到操作:基础模型在具身机器人系统集成中的案例研究
机器人学
2025-11-04 v2
摘要
基础模型 (FM) 越来越多地用于在具身智能体中桥接语言与动作, 但不同 FM 集成策略的运行特征仍未得到充分探索——特别是对于在变化环境中复杂指令遵循和灵活动作生成.本文考察了三种构建机器人系统的范式: 一种是内置感知与规划的端到端视觉-语言-动作 (VLA) 模型, 另两种是集成视觉-语言模型 (VLM) 或多模态大语言模型 (LLM) 的模块化管道.我们通过两个聚焦案例研究进行评估: 一个复杂指令感知任务用于评估细粒度指令理解和跨模态消歧, 一个物体操作任务用于针对 VLA 微调实现技能迁移.我们的实验在零样学习和少样学习设置下揭示了泛化性和数据效率之间的权衡.通过探索性能极限, 我们提炼出开发语言驱动物理智能体的设计含义, 并勾勒出 FM 驱动的机器人在现实条件下面临的新兴挑战和机遇.
引用
@article{arxiv.2505.15685,
title = {From Grounding to Manipulation: Case Studies of Foundation Model Integration in Embodied Robotic Systems},
author = {Xiuchao Sui and Daiying Tian and Qi Sun and Ruirui Chen and Dongkyu Choi and Kenneth Kwok and Soujanya Poria},
journal= {arXiv preprint arXiv:2505.15685},
year = {2025}
}
备注
EMNLP 2025 camera ready