中文

UAVBench:用于自主和智能 AI 无人机系统的开放基准数据集,基于 LLM 生成飞行情景

人工智能 2025-11-17 v1

摘要

自主航空系统日益依赖大语言模型(LLM)用于任务规划、感知与决策,但缺乏标准化且物理依据的基准数据集限制了其推理能力的系统评估。为填补这一空白,我们介绍了 UAVBench——一个由 50,000 个经 taxonomy引导的LLM生成多阶段安全验证的有效无人机飞行情景组成的开放基准数据集。每个情景以结构化 JSON 模式编码,包括任务目标、车辆配置、环境条件及定量风险标签,提供了跨多样化领域的无人机操作统一表征。基于此基础,我们提出了 UAVBench_MCQ——一个包含 50,000 个多选题的推理导向扩展,涵盖十种认知与伦理推理风格,范围从气动学与导航到多智能体协调与综合推理。该框架实现了在真实作业情境下对无人机专属认知能力的可解释且机器可检验评估。我们评估了 32 个最先进的 LLM,包括 GPT-5、ChatGPT-4o、Gemini 2.5 Flash、DeepSeek V3、Qwen3 235B 和 ERNIE 4.5 300B,发现其在感知与政策推理方面表现良好,但在伦理感知与资源受限决策方面仍面临挑战。UAVBench 建立了一个可复现且物理依据的基准框架,用于评估自主航空系统中的智能体 AI,推动下一代无人机推理智能的发展。为支持开放科学与可复现性,我们在 GitHub 上发布了 UAVBench 数据集、UAVBench_MCQ 基准、评估脚本及相关材料,链接为 https://github.com/maferrag/UAVBench

关键词

引用

@article{arxiv.2511.11252,
  title  = {UAVBench: An Open Benchmark Dataset for Autonomous and Agentic AI UAV Systems via LLM-Generated Flight Scenarios},
  author = {Mohamed Amine Ferrag and Abderrahmane Lakas and Merouane Debbah},
  journal= {arXiv preprint arXiv:2511.11252},
  year   = {2025}
}

备注

18 pages, 5 Figures