AirVista-II:面向动态场景语义理解的具身无人机智能体系统
机器人学
2026-05-25 v1 人工智能
摘要
无人机 (UAV) 在物流运输和灾后响应等动态环境中日益重要。然而,当前任务往往依赖人类操作员监控航空视频并作出运营决策,这种人机协作模式在效率和适应性方面存在显著局限。本文提出 AirVista-II —— 一个面向具身无人机的端到端智能体系统,旨在实现动态场景中的通用语义理解与推理。该系统集成了基于智能体的任务识别与调度、多模态感知机制以及针对不同时间场景的差异化关键帧提取策略,有效捕获关键场景信息。实验结果表明,所提出的系统在零样例 setting 下能够实现 diverse UAV 基于动态场景的高质量语义理解。
引用
@article{arxiv.2504.09583,
title = {AirVista-II: An Agentic System for Embodied UAVs Toward Dynamic Scene Semantic Understanding},
author = {Fei Lin and Yonglin Tian and Tengchao Zhang and Jun Huang and Sangtian Guan and Fei-Yue Wang},
journal= {arXiv preprint arXiv:2504.09583},
year = {2026}
}