开放词汇检测器是否能迁移到航空图像上?
计算机视觉与模式识别
2026-02-02 v1 机器学习
机器人学
摘要
开放词汇目标检测(OVD)通过视觉语言模型实现零样本识别新类别,然而在自然图像上取得的优异性能是否能迁移到航空图像上仍未探讨。我们首次系统评估了五种最先进的 OVD 模型在 LAE-80C 航空数据集(3,592 张图像,80 个类别)上的表现,严格遵循零样本条件。我们的实验协议通过全局、Oracle 和单类别推理模式隔离语义混淆与视觉定位问题。结果揭示了严重的域迁移失败:最佳模型(OWLv2)仅 achieving 27.6% F1 分数,误报率为 69%。关键的是,降低词汇量从 80 类到 3.2 类可实现 15 倍改进,表明语义混淆是主要瓶颈。提示工程策略(如领域特定前缀和同义词扩展)未能提供有意义的性能提升。性能在不同数据集间差异极大(F1:DIOR 为 0.53,FAIR1M 为 0.12),暴露了对成像条件的脆弱性。这些发现建立了基线期望值,凸显了航空 OVD 领域自适应方法的必要性。
引用
@article{arxiv.2601.22164,
title = {Do Open-Vocabulary Detectors Transfer to Aerial Imagery? A Comparative Evaluation},
author = {Christos Tsourveloudis},
journal= {arXiv preprint arXiv:2601.22164},
year = {2026}
}