Aquila-plus:面向像素级遥感图像理解的提示驱动视觉语言模型
计算机视觉与模式识别
2024-11-12 v1 人工智能
摘要
视觉语言模型(VLMs)的最新发展通过视觉指令微调推动了视觉-语言集成的重大进展,它们在遥感图像理解领域迅速演进,展示了其强大的能力。然而,现有的RSVLMs主要关注图像级或帧级理解,难以实现细粒度的像素级视觉-语言对齐。此外,基于掩码的指令数据的缺乏限制了它们的进一步发展。在本文中,我们提出了一种名为Aquila-plus的掩码-文本指令微调方法,通过将细粒度掩码区域纳入语言指令,扩展了RSVLMs的能力以实现像素级视觉理解。为此,我们首先精心构建了一个包含100K样本的掩码区域-文本数据集,然后设计了一种视觉语言模型,通过将像素级表示注入大型语言模型(LLM)来实现。具体而言,Aquila-plus使用卷积CLIP作为视觉编码器,并采用掩码感知视觉提取器从高分辨率输入中提取精确的视觉掩码特征。实验结果表明,Aquila-plus在各种区域理解任务上优于现有方法,展示了其在像素级指令微调方面的新能力。
引用
@article{arxiv.2411.06142,
title = {Aquila-plus: Prompt-Driven Visual-Language Models for Pixel-Level Remote Sensing Image Understanding},
author = {Kaixuan Lu},
journal= {arXiv preprint arXiv:2411.06142},
year = {2024}
}