中文

基于图像-文本协作的实时开放词表空中目标检测

计算机视觉与模式识别 2025-07-11 v3

摘要

空中目标检测在众多应用中发挥着关键作用。然而,大多数现有方法仅关注检测预定义目标类别,限制了其在现实场景中的适用性。本文通过图像-文本协作将空中目标检测扩展到开放场景,提出了 RT-OVAD,即首个用于空中场景的实时开放词表检测器。具体而言,我们首先引入图像到文本对齐损失以取代常规类别回归损失,从而消除类别约束。随后,我们提出一种轻量级图像-文本协作策略,包括图像-文本协作编码器和文本引导解码器。编码器同时增强视觉特征并细化文本嵌入,解码器引导对象查询聚焦于与类别相关的图像特征。该设计在不产生显著计算开销的情况下进一步提高检测精度。大量实验表明,RT-OVAD 在开放词表、零样本和传统封闭集检测任务中均优于现有最先进方法。例如,在开放词表空中检测基准 DIOR、DOTA-v2.0 和 LAE-80C 上,RT-OVAD 分别实现了 87.7 AP50、53.8 mAP 和 23.7 mAP,超越了前所未有的 LAE-DINO 提高了 2.2、7.0 和 3.5 分。在此外,RT-OVAD 在 RTX 4090 GPU 上实现约 34 FPS 的推理速度,约为 LAE-DINO(10 FPS)的三倍,满足多样化应用的实时检测需求。代码将在 https://github.com/GT-Wei/RT-OVAD 发布。

关键词

引用

@article{arxiv.2408.12246,
  title  = {RT-OVAD: Real-Time Open-Vocabulary Aerial Object Detection via Image-Text Collaboration},
  author = {Guoting Wei and Xia Yuan and Yu Liu and Zhenhao Shang and Xizhe Xue and Peng Wang and Kelu Yao and Chunxia Zhao and Haokui Zhang and Rong Xiao},
  journal= {arXiv preprint arXiv:2408.12246},
  year   = {2025}
}