空域开放词汇目标检测中的跨视角方法
计算机视觉与模式识别
2025-10-07 v1
摘要
传统目标检测模型通常在固定类别集合上进行训练,限制了其灵活性,并使得引入新类别成本高昂。开放词汇目标检测通过使模型能够在无显式训练的情况下识别未见类别,从而克服了这一限制。利用在大量可用地面视角图像-文本分类对上进行对比式预训练的模型,为空域开放词汇目标检测提供了强大的基础。领域迁移、视角变化和极端尺度差异使得直接跨域知识迁移无效,需专门的适应策略。本文提出一种新框架,用于通过结构化领域对齐将地面视角表示适配以解决空域目标检测问题。该方法引入对比式图像到图像对齐,以增强空域与地面视角嵌入之间的相似性,并采用多实例词汇关联将空域图像与文本嵌入对齐。在 xView、DOTAv2、VisDrone、DIOR 和 HRRSD 数据集上进行大量实验,以验证我们的方法。我们的开放词汇模型在零样设置下相对于微调的闭放词汇数据集特定模型性能,分别在 DOTAv2 上提升 6.32 mAP、VisDrone(图像)上提升 4.16 mAP、HRRSD 上提升 3.46 mAP,从而为空域应用中更灵活和可扩展的目标检测系统铺平了道路。
引用
@article{arxiv.2510.03858,
title = {Cross-View Open-Vocabulary Object Detection in Aerial Imagery},
author = {Jyoti Kini and Rohit Gupta and Mubarak Shah},
journal= {arXiv preprint arXiv:2510.03858},
year = {2025}
}