SatBLIP:基于视觉语言学习的卫星图像上下文理解与特征识别
计算机视觉与模式识别
2026-04-20 v2 人工智能
摘要
农村环境风险由地方性条件(如住房质量、道路通达性、地表格局)塑造,然而标准脆弱性指数较为粗糙,对风险背景的洞察有限。我们提出 SatBLIP,这是一个面向卫星的视觉语言框架,用于农村上下文理解和特征识别,可预测县级社会脆弱性指数(SVI)。SatBLIP 通过将对比图像-文本对齐与针对卫星语义定制的自举式字幕生成相结合,解决了先前遥感流程(手工特征、人工虚拟审核以及基于自然图像训练的 VLM)的局限性。我们使用 GPT-4o 生成卫星瓦片的结构化描述(屋顶类型/状况、房屋大小、庭院属性、绿化及道路背景),然后微调一个经卫星适配的 BLIP 模型,为未见图像生成字幕。字幕经 CLIP 编码,并通过注意力机制与 LLM 导出的嵌入融合,用于空间聚合下的 SVI 估计。利用 SHAP,我们识别出显著属性(如屋顶形式/状况、街道宽度、植被、汽车/开放空间),这些属性一致驱动稳健预测,从而实现对农村风险环境的可解释映射。
引用
@article{arxiv.2604.14373,
title = {SatBLIP: Context Understanding and Feature Identification from Satellite Imagery with Vision-Language Learning},
author = {Xue Wu and Shengting Cao and Shenglin Li and Jiaqi Gong},
journal= {arXiv preprint arXiv:2604.14373},
year = {2026}
}