中文

AERMANI-VLM:面向空中操控的结构化提示与视觉语言模型推理

机器人学 2025-11-04 v1

摘要

视觉-语言模型(Vision-Language Models, VLM)的快速发展催生了对机器人控制的广泛关注,其中自然语言能够表达操作目标,而视觉反馈将感知与动作连接起来。然而,直接将VLM驱动的策略部署到空中操控机器人上仍不安全可靠,因为生成的动作往往不一致、易产生幻觉且在飞行中动态不可行。为此,本文提出AERMANI-VLM——首个为空中操控适配预训练VLM的框架,通过分离高层推理与低层控制实现无需任务特定微调。我们的框架将自然语言指令、任务上下文和安全约束编码为结构化提示,引导模型生成逐步的自然语言推理轨迹。该推理输出用于从预定义的离散、飞行安全技能库中选择动作,确保可解释且时间一致的执行。通过解耦符号推理与物理动作,AERMANI-VLM缓解了幻觉指令并防止不安全行为,实现稳健的任务完成。我们在仿真与硬件平台上验证了该框架,在多步骤抓取-放置任务中表现出强大的对以前未见命令、物体和环境的泛化能力。

关键词

引用

@article{arxiv.2511.01472,
  title  = {AERMANI-VLM: Structured Prompting and Reasoning for Aerial Manipulation with Vision Language Models},
  author = {Sarthak Mishra and Rishabh Dev Yadav and Avirup Das and Saksham Gupta and Wei Pan and Spandan Roy},
  journal= {arXiv preprint arXiv:2511.01472},
  year   = {2025}
}