从像素到文本:推进遥感中的多模态语言模型
计算机视觉与模式识别
2025-12-04 v2 人工智能
机器学习
摘要
遥感已从简单的图像采集发展为能够集成和处理视觉与文本数据的复杂系统。本综述考察了多模态语言模型(MLLMs)在遥感中的发展与应用,重点关注其利用自然语言解释和描述卫星图像的能力。我们涵盖MLLMs的技术基础,包括双编码器架构、Transformer模型、自监督和对比学习以及跨模态融合。遥感数据的独特挑战—— varying spatial resolutions(变化的空间分辨率)、spectral richness(光谱丰富性)和temporal changes(时间变化)——被分析其对MLLM性能的影响。场景描述、目标检测、变化检测、文本到图像检索、图像到文本生成和视觉问答等关键应用被讨论,以展示其在环境监测、城市规划和灾害响应中的相关性。我们回顾了支持这些模型训练和评估的重要数据集和资源。与计算需求、可扩展性、数据质量和领域适应相关的挑战被重点强调。我们通过提出未来研究方向和技术进步来进一步增强MLLM在遥感中的效用作为结论。
引用
@article{arxiv.2411.05826,
title = {From Pixels to Prose: Advancing Multi-Modal Language Models for Remote Sensing},
author = {Xintian Sun and Benji Peng and Charles Zhang and Fei Jin and Qian Niu and Junyu Liu and Keyu Chen and Ming Li and Pohsun Feng and Ziqian Bi and Ming Liu and Xinyuan Song and Yichao Zhang},
journal= {arXiv preprint arXiv:2411.05826},
year = {2025}
}
备注
10 pages, 1 figure