UAV-CodeAgents:基于多智能体 ReAct 与视觉语言推理的可扩展无人机任务规划
机器人学
2025-05-13 v1 人工智能
摘要
我们提出了 UAV-CodeAgents,一个基于大规模语言模型和视觉语言模型 (LLM/VLM) 的可扩展多智能体框架,用于无人机任务生成。系统利用 ReAct(Reason + Act)范式来解释卫星图像、解读高层自然语言指令,并协作生成无人机轨迹,实现最小的人工监督。核心组件是一种基于视觉的像素指向机制,使智能体能够在航空图上精确定位语义目标。为支持实时适应性,我们引入一种反应式思考循环,允许智能体在不断变化的环境中反思观察、修订任务目标并动态协调。我们在涉及工业和环境火灾检测的大规模任务场景中评估了 UAV-CodeAgents。结果表明,较低的解码温度 (0.5) 可产生更高的规划可靠性和更短的执行时间,平均任务创建时间为 96.96 秒,成功率为 93%。我们进一步在 9,000 张标注卫星图像上微调 Qwen2.5VL-7B,实现了跨多样化视觉类别的强大空间定位能力。为促进可重复性和未来研究,我们将公开完整代码库及一个用于视觉语言无人机规划的新型基准数据集。
引用
@article{arxiv.2505.07236,
title = {UAV-CodeAgents: Scalable UAV Mission Planning via Multi-Agent ReAct and Vision-Language Reasoning},
author = {Oleg Sautenkov and Yasheerah Yaqoot and Muhammad Ahsan Mustafa and Faryal Batool and Jeffrin Sam and Artem Lykov and Chih-Yung Wen and Dzmitry Tsetserukou},
journal= {arXiv preprint arXiv:2505.07236},
year = {2025}
}
备注
Submitted