中文

DescribeEarth:为遥感图像生成通用描述

计算机视觉与模式识别 2025-10-01 v1

摘要

自动生成遥感图像的文本描述对于从环境监测、城市规划到灾害管理等多样化应用中发挥其全部潜力至关重要。然而,现有遥感图像描述研究主要聚焦于图像层面,缺乏对象级别的细粒度解释,限制了其充分利用和转化遥感图像中所蕴含的丰富语义和结构信息。为此,我们提出了Geo-DLC,即遥感对象级别细粒度图像描述的新任务。为支持该任务,我们构建了DE-Dataset,包含25个类别和261,806个标注实例,涵盖对象属性、关系和上下文的详细描述。此外,我们引入了DE-Benchmark,一个基于LLM辅助问答的评估套件,旨在系统性地衡量模型在Geo-DLC任务中的能力。我们还提出了DescribeEarth,一个专为Geo-DLC设计的多模态大语言模型(MLLM)架构,集成了尺度自适应焦点策略和领域引导融合模块,利用遥感视觉语言模型特征对高分辨率细节和遥感类别先验进行编码,同时保持全局语境。我们的DescribeEarth模型在DE-Benchmark上 consistently 优于当今最先进的通用MLLM,展现出卓越的事实准确性、描述丰富性和语法正确性,尤其在捕捉遥感场景中简单、复杂乃至超分布(out-of-distribution)对象的内在特征及其周围环境属性方面表现突出。所有数据、代码和模型权重已发布于https://github.com/earth-insights/DescribeEarth。

关键词

引用

@article{arxiv.2509.25654,
  title  = {DescribeEarth: Describe Anything for Remote Sensing Images},
  author = {Kaiyu Li and Zixuan Jiang and Xiangyong Cao and Jiayu Wang and Yuchen Xiao and Deyu Meng and Zhi Wang},
  journal= {arXiv preprint arXiv:2509.25654},
  year   = {2025}
}