基于可变形视觉转换器的土地覆盖创建:用于土地覆盖分类的 LC4-DViT
摘要
土地覆盖是生态服务、水文调节、灾害风险缓解和基于证据的土地规划的基础;因此,及时、准确的土地覆盖图对于环境管理至关重要。遥感基于土地覆盖分类提供了实现此类图的可扩展途径,但受限于稀缺和不平衡的注释以及高分辨率场景中的几何畸变。我们提出了 LC4-DViT(Land-cover Creation for Land-cover Classification with Deformable Vision Transformer),一个结合生成数据创建和可变形视觉转换器的框架。文本引导的扩散管道使用 GPT-4o 生成的场景描述和超分辨示例来合成类别平衡、高保真训练图像,而 DViT 将 DCNv4 可变形卷积背板与视觉转换器编码器耦合,以 jointly 捕获细尺度几何和全局上下文。在来自 Aerial Image Dataset(AID)-Beach、Bridge、Desert、Forest、Mountain、Pond、Port 和 River-DViT八个类别上,LC4-DViT 实现了 0.9572 的总体准确率、0.9576 的宏 F1 分数和 0.9510 的 Cohen's Kappa,优于基于 ViT 的基线(0.9274 OA、0.9300 宏 F1、0.9169 Kappa)以及 ResNet50、MobileNetV2 和 FlashInternImage。在三个类的 SIRI-WHU 子集(Harbor、Pond、River)上的跨数据集实验结果为 0.9333 的总体准确率、0.9316 的宏 F1 和 0.8989 的 Kappa,表明其良好的可迁移性。基于 GPT-4o 的 LLM 评委对 Grad-CAM 热图进行评分的实验进一步表明,DViT 的注意力机制对水文学有意义的结构最为匹配。这些结果表明,描述驱动的生成数据增强结合可变形转换器是高分辨率土地覆盖制图的有前景的 method。
引用
@article{arxiv.2511.22812,
title = {LC4-DViT: Land-cover Creation for Land-cover Classification with Deformable Vision Transformer},
author = {Kai Wang and Siyi Chen and Weicong Pang and Chenchen Zhang and Renjun Gao and Ziru Chen and Cheng Li and Dasa Gu and Rui Huang and Alexis Kai Hon Lau},
journal= {arXiv preprint arXiv:2511.22812},
year = {2026}
}
备注
This work has been submitted to the IEEE for possible publication.The project is available at https://github.com/weicongpang/LVC2-DViT.git