面向细粒度船舶分类的大规模视觉语言模型高效提示微调
计算机视觉与模式识别
2024-12-02 v2 人工智能
摘要
遥感图像中的细粒度船舶分类 (RS-FGSC) 因类别间高度相似性和标注数据有限而构成重大挑战,限制了传统监督分类方法的有效性。大规模预训练视觉语言模型 (VLM) 的最新进展在少样本或零样本学习中展现了令人印象深刻的能力,尤其是在理解图像内容方面。本研究深入探讨了利用 VLM 的潜力来提升对未见船舶类别的分类精度,这在因成本或隐私限制导致数据受限的场景中具有重要意义。直接微调 VLM 用于 RS-FGSC 常遇到对已见类别的过拟合问题,导致对未见类别的泛化能力欠佳,这凸显了区分复杂背景和捕捉独特船舶特征的困难。为解决这些问题,我们引入了一种新颖的提示微调技术,采用分层、多粒度的提示设计。我们的方法通过从一个小的可训练网络学习的偏置项来集成遥感船舶先验知识。该策略增强了模型的泛化能力,同时提高了其辨别复杂背景和学习判别性船舶特征的能力。此外,我们通过引入一个全面的数据集 FGSCM-52 为该领域做出贡献,该数据集以更广泛的数据和针对不常见船舶类别的详细标注显著扩展现有数据集。广泛的实验评估证明了我们提出的方法优于当前最先进的技术。源代码将公开发布。
引用
@article{arxiv.2403.08271,
title = {Efficient Prompt Tuning of Large Vision-Language Model for Fine-Grained Ship Classification},
author = {Long Lan and Fengxiang Wang and Xiangtao Zheng and Zengmao Wang and Xinwang Liu},
journal= {arXiv preprint arXiv:2403.08271},
year = {2024}
}
备注
It has been accepted by TGRS