遥感视觉问答的大型视觉语言模型
计算机视觉与模式识别
2024-11-19 v1 计算与语言
摘要
遥感视觉问答(RSVQA)是一个具有挑战性的任务,涉及解释复杂卫星图像以回答自然语言问题。传统方法常依赖独立的视觉特征提取器和语言处理模型,这些模型在处理开放式问题方面计算密集且受限。本文提出了一种新方法,利用生成式大型视觉语言模型(LVLM)简化 RSVQA 流程。我们的方法包含两个步骤的训练策略:领域自适应预训练和基于提示的微调。该方法使 LVLM 能够通过对视觉和文本输入进行条件化,生成自然语言答案,而无需预定义答案类别。我们在 RSVQAxBEN 数据集上进行评估,显示其优于基于最新方法的基准。此外,一项人类评估研究表明,我们的方法生成的答案在准确性、相关性和流畅性方面更优。结果凸显了生成式 LVLM 在推动遥感分析领域发展方面的潜力。
引用
@article{arxiv.2411.10857,
title = {Large Vision-Language Models for Remote Sensing Visual Question Answering},
author = {Surasakdi Siripong and Apirak Chaiyapan and Thanakorn Phonchai},
journal= {arXiv preprint arXiv:2411.10857},
year = {2024}
}