MetaSegNet:面向遥感图像语义分割的元数据协作视觉-语言表示学习
计算机视觉与模式识别
2024-10-31 v3
摘要
遥感图像的语义分割在广泛的地球观测应用中发挥着至关重要的作用,例如土地利用/土地覆盖制图、环境监测和可持续发展。受人工智能快速发展的推动,深度学习(DL)已成为语义分割的主流方法,并在遥感领域取得了许多突破。然而,大多数基于DL的方法专注于单模态视觉数据,而忽略了现实世界中涉及的丰富多模态信息。非视觉数据(如文本)可以从现实世界收集额外知识,从而增强视觉模型的可解释性、可靠性和泛化能力。受此启发,我们提出了一种新颖的元数据协作分割网络(MetaSegNet),该网络应用视觉-语言表示学习进行遥感图像的语义分割。与仅使用单模态视觉数据的常见模型结构不同,我们从免费可用的遥感图像元数据中提取关键特征(例如气候带),并通过通用ChatGPT将其转换为地理文本提示。然后,我们构建了图像编码器、文本编码器和跨模态注意力融合子网络,以提取图像和文本特征并进行图像-文本交互。得益于这种设计,所提出的MetaSegNet不仅在零样本测试中表现出优越的泛化能力,而且在大型OpenEarthMap数据集(70.4% mIoU)、Potsdam数据集(93.3%平均F1分数)以及LoveDA数据集(52.0% mIoU)上取得了与最先进语义分割方法相竞争的精度。
引用
@article{arxiv.2312.12735,
title = {MetaSegNet: Metadata-collaborative Vision-Language Representation Learning for Semantic Segmentation of Remote Sensing Images},
author = {Libo Wang and Sijun Dong and Ying Chen and Xiaoliang Meng and Shenghui Fang and Songlin Fei},
journal= {arXiv preprint arXiv:2312.12735},
year = {2024}
}
备注
Accepted by IEEE Transactions on Geoscience and Remote Sensing