中文

ROSGPT_Vision:仅用语言模型提示指挥机器人

机器人学 2025-02-18 v2 人工智能

摘要

本文提出,下一代机器人可仅通过语言模型提示进行指挥。每个提示分别通过其一模态语言模型(MLM)询问特定的机器人模态。一个中央任务模态借助大语言模型(LLM)协调整体通信以执行机器人任务。本文将这一新型机器人设计模式命名为:提示机器人模态(PRM)。此外,本文将该 PRM 设计模式应用于构建名为 ROSGPT_Vision 的新机器人框架。ROSGPT_Vision 仅使用两个提示即可执行机器人任务:一个视觉提示和一个 LLM 提示。视觉提示以自然语言提取与当前任务相关的视觉语义特征(视觉机器人模态)。同时,LLM 提示调节机器人对视觉描述的反应(任务模态)。该框架自动化了这两个提示背后的所有机制。框架使机器人能够通过处理视觉数据、做出明智决策并自动执行动作来应对复杂现实场景。框架包含一个通用视觉模块与两个独立 ROS 节点。作为测试应用,我们使用 ROSGPT_Vision 开发了 CarMate,用于监测驾驶员在路上分心并向驾驶员进行实时语音提醒。我们展示了 ROSGPT_Vision 相比传统方法显著降低了开发成本。我们演示了如何通过优化提示策略提升应用质量,而不深入技术细节。ROSGPT_Vision 已向社区开源(链接:https://github.com/bilel-bj/ROSGPT_Vision),以推动该方向的机器人研究,并构建更多实现 PRM 设计模式、仅用提示控制机器人的框架。

关键词

引用

@article{arxiv.2308.11236,
  title  = {ROSGPT_Vision: Commanding Robots Using Only Language Models' Prompts},
  author = {Bilel Benjdira and Anis Koubaa and Anas M. Ali},
  journal= {arXiv preprint arXiv:2308.11236},
  year   = {2025}
}