中文

无人机影像中基于文本-图像对齐的开放词汇目标检测:综述与未来展望

计算机视觉与模式识别 2025-07-21 v1

摘要

由于其广泛的应用,无人机航空图像目标检测长期是计算机视觉中的热门话题。近年来,无人机技术的发展进一步推动了该领域迈向新高度,催生了更广泛的应用需求。然而,传统的无人机航空目标检测方法主要聚焦于检测预定义类别,显著限制了其适用性。基于文本-图像对齐(如 CLIP)的跨模态技术克服了这一限制,实现开放词汇目标检测 (OVOD),使其能够通过自然语言描述识别以往未出现的目标。这一突破显著提升了无人机在航空场景理解中的智能性与自主性。本文综述了无人机航空场景中的 OVOD。我们首先将 OVOD 的核心原理与无人机视觉的独特特征对齐,为后续讨论奠定基础。在此基础上,构建系统化的分类框架,梳理现有无人机航空图像的 OVOD 方法,并全面概述相关数据集。该结构化综述使我们能够批判性地剖析这些领域的关键挑战与开放问题。最后,基于上述分析,我们阐述了具有前景的未来研究方向与应用前景。本综述旨为新手与资深研究者提供清晰的路线图与宝贵参考,推动该快速演进领域的创新。我们持续跟踪相关工作,地址: https://github.com/zhouyang2002/OVOD-in-UVA-imagery

关键词

引用

@article{arxiv.2507.13359,
  title  = {Open-Vocabulary Object Detection in UAV Imagery: A Review and Future Perspectives},
  author = {Yang Zhou and Junjie Li and CongYang Ou and Dawei Yan and Haokui Zhang and Xizhe Xue},
  journal= {arXiv preprint arXiv:2507.13359},
  year   = {2025}
}

备注

27 pages, 5 figures