中文

基于提示词的强化学习用于视觉覆盖路径规划

机器人学 2025-07-15 v1 多智能体系统

摘要

无人机(UAV)的视觉覆盖路径规划要求智能体战略性地协调无人机运动和摄像头控制,以最大化覆盖率、最小化冗余度并维持电池效率。传统强化学习(RL)方法依赖于环境特定的奖励函数式样,缺乏语义适应性。本研究提出了提示词驱动强化学习(Prompt-Informed Reinforcement Learning, PIRL),一种新方法,将大型语言模型的零样本推理能力和情境学习能力与好奇心驱动的 RL 结合起来。PIRL 利用来自大型语言模型 GPT-3.5 的语义反馈,动态塑造引导智能体进行位置和摄像头调整以实现最佳视觉覆盖的 Proximal Policy Optimization(PPO) RL 策略的奖励函数。PIRL 代理使用 OpenAI Gym 进行训练,并在 various 环境中进行评估。此外,通过在 Webots 模拟器中运行 agent 来测试其类似现实的迁移能力和零样本泛化能力,该模拟器引入了真实的物理动力学。结果表明,PIRL 在多个基于学习的基线上超越,包括基于静态奖励的 PPO、基于探索性权重初始化的 PPO、模仿学习和仅使用 LLM 的控制器。在不同环境中,PIRL 相较于表现最好的基线实现了最高可达 14% 的视觉覆盖提升(OpenAI Gym 中)和 27% 的提升(Webots 中),最高可达 25% 的电池效率提升,以及最高可达 18% 的冗余度降低,具体取决于环境。这些结果凸显了 LLM 指导奖励塑造在复杂空间探索任务中的有效性,并为将自然语言先验引入 RL 用于机器人学指明了前景。

关键词

引用

@article{arxiv.2507.10284,
  title  = {Prompt Informed Reinforcement Learning for Visual Coverage Path Planning},
  author = {Venkat Margapuri},
  journal= {arXiv preprint arXiv:2507.10284},
  year   = {2025}
}