Aquila:一种分层对齐的视觉语言模型,用于增强遥感图像理解
计算机视觉与模式识别
2024-11-12 v1 人工智能
摘要
近期,大视觉语言模型(VLMs)通过视觉指令调优在视觉语言能力方面取得了显著进展,在遥感图像解释领域展现出巨大前景。然而,现有的遥感视觉语言模型(RSVLMs)通常难以捕捉遥感场景的复杂特征,因为它们通常依赖低分辨率、单尺度视觉特征以及将视觉特征映射到语言特征的简单方法。在本文中,我们提出了Aquila,一个先进的视觉语言基础模型,旨在为遥感图像实现更丰富的视觉特征表示和更精确的视觉-语言特征对齐。我们的方法引入了一个可学习的层次化空间特征整合(SFI)模块,支持高分辨率图像输入并聚合多尺度视觉特征,从而实现对复杂视觉信息的详细表示。此外,SFI模块被反复整合到大语言模型(LLM)的各层中,以实现深度的视觉-语言特征对齐,同时不损害模型在自然语言处理任务中的性能。这些创新——通过更高分辨率和多尺度输入捕获详细视觉效应,以及增强特征对齐——显著提升了模型从图像-文本数据中学习的能力。我们通过广泛的定量实验和定性分析验证了Aquila的有效性,展示了其优越的性能。
引用
@article{arxiv.2411.06074,
title = {Aquila: A Hierarchically Aligned Visual-Language Model for Enhanced Remote Sensing Image Comprehension},
author = {Kaixuan Lu and Ruiqian Zhang and Xiao Huang and Yuxing Xie},
journal= {arXiv preprint arXiv:2411.06074},
year = {2024}
}