中文

增强遥感视觉-语言模型以实现零样本场景分类

计算机视觉与模式识别 2025-01-08 v2

摘要

得益于其广泛的预训练,遥感视觉-语言模型已显示出有前景的用途。然而,它们在零样本场景分类方法中的常规使用仍然涉及将大图像分割成小块并进行独立预测,即归纳推理,从而因忽略有价值的上下文信息而限制了其有效性。我们的方法通过利用基于文本提示的初始预测和来自图像编码器的图像块亲和关系,通过转导推理来增强零样本能力,这一切都无需监督且计算成本极低。在10个遥感数据集上使用最先进的视觉-语言模型进行的实验表明,与归纳式零样本分类相比,准确率有显著提高。我们的源代码已在Github上公开:https://github.com/elkhouryk/RS-TransCLIP。

关键词

引用

@article{arxiv.2409.00698,
  title  = {Enhancing Remote Sensing Vision-Language Models for Zero-Shot Scene Classification},
  author = {Karim El Khoury and Maxime Zanella and Benoît Gérin and Tiffanie Godelaine and Benoît Macq and Saïd Mahmoudi and Christophe De Vleeschouwer and Ismail Ben Ayed},
  journal= {arXiv preprint arXiv:2409.00698},
  year   = {2025}
}

备注

Accepted at ICASSP 2025