基于基础模型的具身AI在移动服务机器人中的应用:系统综述
机器人学
2026-03-11 v2 人工智能
计算与语言
计算机视觉与模式识别
机器学习
摘要
基础模型的快速发展,包括大语言模型、视觉语言模型、多模态大语言模型和视觉-语言-动作模型,为移动服务机器人中的具身AI开辟了新途径。通过将基础模型与具身AI原理(即智能系统通过物理交互进行感知、推理和行动)相结合,移动服务机器人能够在动态的真实世界环境中实现更灵活的理解、自适应行为和稳健的任务执行。尽管取得了这些进展,面向移动服务机器人的具身AI在将自然语言指令转化为可执行机器人动作、以人为中心环境中的多模态感知、安全决策的不确定性估计以及实时机载部署的计算约束等方面,仍面临根本性挑战。本文首次针对基础模型在移动服务机器人中的集成进行系统综述。我们分析了基础模型的最新进展如何通过语言条件控制、多模态传感器融合、不确定性感知推理和高效模型缩放来应对这些核心挑战。我们进一步考察了在家庭辅助、医疗保健和服务自动化领域的实际应用,重点阐述了基础模型如何实现具备上下文感知、社会响应和泛化能力的机器人行为。除技术考量外,我们还讨论了在人类环境中部署基于基础模型的服务机器人所带来的伦理、社会和人机交互影响。最后,我们概述了未来的研究方向,强调实现安全、可扩展且可信的移动服务机器人所需的可靠性与终身适应、隐私感知与资源受限部署,以及治理和人机协同框架。
引用
@article{arxiv.2505.20503,
title = {Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review},
author = {Matthew Lisondra and Beno Benhabib and Goldie Nejat},
journal= {arXiv preprint arXiv:2505.20503},
year = {2026}
}
备注
v2: Expanded systematic review; resubmitted to Robotics