CLIP 面向军用车辆分类的遮挡鲁棒性
计算机视觉与模式识别
2025-09-03 v2 人工智能
摘要
视觉语言模型 (VLM) 如 CLIP 通过在共享嵌入空间中对齐图像和文本,实现零时分类,为数据稀缺的防务应用提供了优势。然而,CLIP 在面对挑战性军事环境(部分遮挡和信号信噪比 (SNR) 降低)时的鲁棒性仍未得到充分探索。我们使用包含 18 类军用车辆的自定义数据集评估 CLIP 变体对遮挡的鲁棒性,并通过归一化曲线下面积 (NAUC) 进行评估。四个关键见解浮现:(1) 基于 Transformer 的 CLIP 模型持续优于 CNN;(2) 细粒度、分布式遮挡对性能影响大于较大连续遮挡;(3) 尽管提高了准确率,线性探针模型在约 35% 遮挡时性能骤降;(4) 通过对模型 backbone 进行微调,这一性能下降点可推迟至超过 60% 遮挡。这些结果凸显了在训练期间进行针对遮挡的特定增强以及进一步探索 patch 级别敏感性和体系结构鲁棒性对实际部署 CLIP 的重要性。
引用
@article{arxiv.2508.20760,
title = {Occlusion Robustness of CLIP for Military Vehicle Classification},
author = {Jan Erik van Woerden and Gertjan Burghouts and Lotte Nijskens and Alma M. Liezenga and Sabina van Rooij and Frank Ruis and Hugo J. Kuijf},
journal= {arXiv preprint arXiv:2508.20760},
year = {2025}
}
备注
To be presented at SPIE: Sensors + Imaging, Artificial Intelligence for Security and Defence Applications II