中文

AirVista-II:面向动态场景语义理解的具身无人机智能体系统

机器人学 2026-05-25 v1 人工智能

摘要

无人机 (UAV) 在物流运输和灾后响应等动态环境中日益重要。然而,当前任务往往依赖人类操作员监控航空视频并作出运营决策,这种人机协作模式在效率和适应性方面存在显著局限。本文提出 AirVista-II —— 一个面向具身无人机的端到端智能体系统,旨在实现动态场景中的通用语义理解与推理。该系统集成了基于智能体的任务识别与调度、多模态感知机制以及针对不同时间场景的差异化关键帧提取策略,有效捕获关键场景信息。实验结果表明,所提出的系统在零样例 setting 下能够实现 diverse UAV 基于动态场景的高质量语义理解。

关键词

引用

@article{arxiv.2504.09583,
  title  = {AirVista-II: An Agentic System for Embodied UAVs Toward Dynamic Scene Semantic Understanding},
  author = {Fei Lin and Yonglin Tian and Tengchao Zhang and Jun Huang and Sangtian Guan and Fei-Yue Wang},
  journal= {arXiv preprint arXiv:2504.09583},
  year   = {2026}
}