中文

基于视觉描述正则化的零样本航空目标检测

计算机视觉与模式识别 2024-03-04 v2

摘要

现有的目标检测模型主要在大规模标注数据集上进行训练。然而,为新类别的航空目标标注数据成本高昂,因为这既耗时又可能需要专业知识。因此,研究航空图像中标签高效的目标检测方法显得尤为必要。在本文中,我们提出了一种名为视觉描述正则化(DescReg)的航空目标检测零样本方法。具体而言,我们识别出航空目标较弱的语义 - 视觉相关性,并旨在利用其视觉外观的先验描述来应对这一挑战。我们并非直接将描述编码到类嵌入空间中(这会遭受表示差距问题的困扰),而是提议将描述中传达的先验类间视觉相似性注入到嵌入学习中。该注入过程通过新设计的相似性感知三元组损失完成,该损失对表示空间引入了结构化正则化。我们在三个具有挑战性的航空目标检测数据集(包括 DIOR、xView 和 DOTA)上进行了广泛实验。结果表明,DescReg 显著优于具有复杂投影设计和生成框架的最先进零样本检测 (ZSD) 方法;例如,在 DIOR 数据集上,DescReg 在未见类上的表现比最佳报道的 ZSD 方法高出 4.5 mAP,调和均值 (HM) 高出 8.1。我们进一步通过将 DescReg 集成到生成式 ZSD 方法中以及改变检测架构,展示了 DescReg 的泛化能力。

关键词

引用

@article{arxiv.2402.18233,
  title  = {Zero-Shot Aerial Object Detection with Visual Description Regularization},
  author = {Zhengqing Zang and Chenyu Lin and Chenwei Tang and Tao Wang and Jiancheng Lv},
  journal= {arXiv preprint arXiv:2402.18233},
  year   = {2024}
}

备注

13 pages, 3 figures