基于 Vision-Language 模型的半监督遥感图像语义分割
计算机视觉与模式识别
2026-02-03 v1 人工智能
摘要
半监督语义分割(S4)可从低成本的无标签图像中学习丰富的视觉知识,但传统 S4 架构都面临低质量伪标签的挑战,尤其是教师-学生框架。我们提出一种 Novel SemiEarth 模型,引入视觉语言模型(VLM)以解决遥感(RS)领域的 S4 问题。具体而言,我们设计了 VLM 伪标签净化(VLM-PP)结构,以净化教师网络的伪标签,取得显著提升。尤其在 RS 图像的多类边界区域,VLM-PP 模块可显著提高教师生成的伪标签质量,从而正确指导学生模型的学习。此外,由于 VLM-PP 赋予 VLMs 开放式能力且独立于 S4 架构,当其预测与伪标签发生偏差时,即可纠正低置信度伪标签中的错误分类。我们在多个 RS 数据集上进行了广泛实验,结果表明 SemiEarth 实现了 SOTA 水平。更重要的是,与之前的 SOTA RS S4 方法不同,我们的模型不仅实现卓越性能,还提供良好的可解释性。代码已发布于 https://github.com/wangshanwen001/SemiEarth。
引用
@article{arxiv.2602.00202,
title = {Vision-Language Model Purified Semi-Supervised Semantic Segmentation for Remote Sensing Images},
author = {Shanwen Wang and Xin Sun and Danfeng Hong and Fei Zhou},
journal= {arXiv preprint arXiv:2602.00202},
year = {2026}
}