LHRS-Bot:利用VGI增强的大型多模态语言模型赋能遥感
计算机视觉与模式识别
2024-07-17 v4 人工智能
机器学习
摘要
大型语言模型(LLM)的革命性能力为多模态大型语言模型(MLLM)铺平了道路,并促进了跨各种专业领域的多样化应用。然而,在遥感(RS)领域,最近的MLLM工作并未充分考虑遥感影像中多样的地理景观和变化的目标。为弥合这一差距,我们利用广泛的志愿地理信息(VGI)和全球可用的遥感影像,构建了一个大规模遥感图像-文本数据集LHRS-Align和一个信息丰富的遥感专用指令数据集LHRS-Instruct。在此基础上,我们通过一种新颖的多级视觉-语言对齐策略和课程学习方法,引入了专为遥感图像理解定制的MLLM——LHRS-Bot。此外,我们还引入了LHRS-Bench,一个用于全面评估MLLM在遥感图像理解方面能力的基准。综合实验表明,LHRS-Bot展现出对遥感图像的深刻理解以及在遥感领域内进行细致推理的能力。
引用
@article{arxiv.2402.02544,
title = {LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model},
author = {Dilxat Muhtar and Zhenshi Li and Feng Gu and Xueliang Zhang and Pengfeng Xiao},
journal= {arXiv preprint arXiv:2402.02544},
year = {2024}
}
备注
36 pages, 10 figures. Github https://github.com/NJU-LHRS/LHRS-Bot