AerialMind:面向无人机场景的引用式多目标跟踪
机器人学
2025-12-02 v2 计算机视觉与模式识别
摘要
引用式多目标跟踪(RMOT)旨在通过自然语言指令实现精确的目标检测与跟踪,代表智能机器人系统的基本能力。然而,当前RMOT研究大多局限于地面场景,这限制了其捕捉大范围场景上下文以及进行全面跟踪与路径规划的能力。相比之下,无人机(UAV)利用其广阔的空中视角和优越的机动性,实现了大范围监控。此外,无人机已成为具身智能的关键平台,由此催生了对具备自然语言交互能力的智能空中系统的前所未有的需求。为此,我们提出了AerialMind——首个面向无人机场景的大规模RMOT基准,旨在弥合这一研究空白。为促进其构建,我们开发了一种创新的半自动化协作智能体标注辅助(COALA)框架,在保持标注质量的同时显著降低了人工成本。此外,我们提出了HawkEyeTrack(HETrack),一种通过协同增强视觉-语言表示学习来改善无人机场景感知的新方法。全面的实验验证了我们数据集的 challenging 性质以及我们方法的有效性。
引用
@article{arxiv.2511.21053,
title = {AerialMind: Towards Referring Multi-Object Tracking in UAV Scenarios},
author = {Chenglizhao Chen and Shaofeng Liang and Runwei Guan and Xiaolou Sun and Haocheng Zhao and Haiyun Jiang and Tao Huang and Henghui Ding and Qing-Long Han},
journal= {arXiv preprint arXiv:2511.21053},
year = {2025}
}
备注
AAAI 2026