基于物理约束感知大语言模型规划器的多机器人防碰撞与可达性控制
机器人学
2025-06-05 v2 人工智能
摘要
大语言模型(LLMs)在多种机器人控制任务中展现出强大性能,但其在真实场景中的部署仍受限制。即便是最先进的大语言模型(如 GPT-o4mini),也经常生成违反物理约束的无效动作规划,例如将机器人导向不可达位置或导致机器人间碰撞。这一问题主要源于推理过程中缺乏对这些物理约束的感知。为解决此问题,我们提出一种新颖框架,将强化学习与可验证奖励(RLVR)相结合,以激励大语言模型学习物理约束知识,从而在规划生成时进行约束感知推理。在该方法中,只有成功完成控制任务的有效动作规划才能获得正奖励。我们将方法应用于两个小规模大语言模型:非推理型 Qwen2.5-3B-Instruct 和推理型 Qwen3-4B。实验结果表明,在 BoxNet 任务和基于 MuJoCo 新构建的 BoxNet3D 环境中,具有约束感知的小型大语言模型在性能上大幅优于无约束的大规模模型。本工作强调了即使小型大语言模型,通过融入物理约束也能在复杂、物理受限的环境中实现可扩展且高效的多机器人控制。
引用
@article{arxiv.2505.20573,
title = {Collision- and Reachability-Aware Multi-Robot Control with Grounded LLM Planners},
author = {Jiabao Ji and Yongchao Chen and Yang Zhang and Ramana Rao Kompella and Chuchu Fan and Gaowen Liu and Shiyu Chang},
journal= {arXiv preprint arXiv:2505.20573},
year = {2025}
}