中文

无需人工标注地推动视觉语言模型在遥感领域的极限

计算机视觉与模式识别 2024-09-12 v1

摘要

通用基础模型在视觉语言集成方面的突破,使得其在众多应用中获得了关注。由于在自然领域,构建这些基础模型所需的视觉语言数据集易于获取且便于网络爬虫抓取。相反,在遥感领域,虽然存在视觉语言数据集,但其规模不足以构建稳健的基础模型。本研究提出了一种方法,通过利用图像解码机器学习模型来构建视觉语言数据集,从而无需人工标注。通过该方法,我们收集了约 960 万对遥感图像中的 VHR 图像的视觉语言配对数据集。结果模型在众多下游任务上(如零样本分类、语义定位和图像-文本检索)均优于不利用公开视觉语言数据集的模型,尤其在仅使用视觉编码器的任务(如线性探测和 k 近邻分类)中,还优于依赖特定领域视觉语言数据集的模型。

关键词

引用

@article{arxiv.2409.07048,
  title  = {Pushing the Limits of Vision-Language Models in Remote Sensing without Human Annotations},
  author = {Keumgang Cha and Donggeun Yu and Junghoon Seo},
  journal= {arXiv preprint arXiv:2409.07048},
  year   = {2024}
}

备注

This study was primarily conducted during the latter half of 2023