掩码可以说话:从单模态图像中提取遥感变化检测的结构化文本信息
计算机视觉与模式识别
2026-05-11 v1
摘要
遥感变化检测是城市监测、灾后评估和环境资源管理的关键环节。然而,单模态深度学习方法常将真实语义变化误认为视觉上相似但无关的变化。近期多模态方法将文本作为辅助监督,但其描述要么语义粗糙且非结构化,要么是模型生成的因此噪声。严重忽视了一个简单事实:细粒度的变化语义已隐式编码在每张变化检测数据集标准提供的 ground-truth 掩码标签中。这些掩码知道变化发生在哪里、变化前后的土地覆盖类型、转换方式以及涉及的目标数量。在本文中,我们提出 S2M 框架,从变化标签中零成本获取结构化文本特征。具体而言,将每个变化区域自动转录为语义四元组 (where, what, how, how many),并转换为若干固定模板文本描述,提供精确、稠密且无噪声的多模态监督。我们采用两阶段训练策略,首先在遥感影像上进行鲁棒的领域特定表征微调,随后引入具有双向对比损失的多模态解码器,以实现视觉特征与结构化文本嵌入的深度对齐。为验证我们的方法,我们构建了覆盖加沙地区的 Gaza-Change-v2 新型多类变化检测数据集。在该 MCD 数据集上,S2M 在 Sek 上达到 17.80%,F_{\text{scd}} 为 66.14%,显著优于即使利用大型语言模型的多模态方法。我们的工作表明,掩码确实可以说话。它们准确告诉我们发生了什么、在哪里、如何以及有多少变化。
引用
@article{arxiv.2605.07178,
title = {Masks Can Talk: Extracting Structured Text Information from Single-Modal Images for Remote Sensing Change Detection},
author = {Kai Zheng and Hang-Cheng Dong and Jiatong Pan and Zhenkai Wu and Fupeng Wei and Wei Zhang},
journal= {arXiv preprint arXiv:2605.07178},
year = {2026}
}