遥感基础模型综述:从视觉到多模态
计算机视觉与模式识别
2025-03-31 v1
摘要
遥感基础模型的快速发展,尤其是视觉模型和多模态模型,显著提升了智能遥感地理空间数据解释的能力。这些模型将各种数据模态(如光学、雷达和 LiDAR 影像)与文本和地理信息相结合,实现了对遥感数据的更全面分析和理解。多模态集成允许在对象检测、地覆盖分类和变化检测等任务中实现更好的性能,而这些任务往往受到遥感数据复杂性和异构性的挑战。尽管如此,尽管已取得这些进展,但仍存在若干挑战。数据类型的多样性、需要大规模标注数据集,以及多模态融合技术的复杂性构成了这些模型在实际应用中有效部署的重大障碍。此外,训练和微调多模态模型的计算需求巨大,进一步复杂化了其在遥感图像解释任务中的实际应用。本文综述了遥感视觉和多模态基础模型的最新进展,关注其架构、训练方法、数据集和应用场景。我们讨论了这些模型所面临的关键挑战,如数据对齐、跨模态迁移学习和可扩展性,同时也指出了旨在克服这些限制的新兴研究方向。我们的目标是为遥感基础模型的当前格局提供清晰的理解,激发未来研究以推动这些模型在实际应用中能够实现的边界。本文收集的资源列表可在 https://github.com/IRIP-BUAA/A-Review-for-remote-sensing-vision-language-models 查找。
引用
@article{arxiv.2503.22081,
title = {A Survey on Remote Sensing Foundation Models: From Vision to Multimodality},
author = {Ziyue Huang and Hongxi Yan and Qiqi Zhan and Shuai Yang and Mingming Zhang and Chenkai Zhang and YiMing Lei and Zeming Liu and Qingjie Liu and Yunhong Wang},
journal= {arXiv preprint arXiv:2503.22081},
year = {2025}
}