中文

面向森林生态分析的统一视觉语言模型

计算机视觉与模式识别 2025-11-24 v1

摘要

近期视觉语言模型(VLM)的进展展现了卓越的感知与推理能力,但其在地球观测(EO)中的科学回归潜力尚未得到充分探索。现有 EO 数据集主要侧重于语义理解任务,如描述生成或分类,缺乏将多模态感知与可衡量生物物理变量对齐的基准数据集。为填补这一空白,我们提出 REO-Instruct——首个面向描述性与回归性任务的统一基准数据集。REO-Instruct 在森林生态情境(人类活动、遥感图分类、生态拼图计数、地上生物量(AGB)回归)中构建了可解释的认知逻辑链,桥接定性理解与定量预测。数据集整合了共配准的 Sentinel-2 和 ALOS-2 遥感影像,采用混合人类-人工智能管道生成并验证结构化文本标注。全面的评估协议与基线结果表明,当前模型在数值推理方面表现不足,这凸显了科学 VLM 的关键挑战。REO-Instruct 为开发和评估下一代具备描述与科学推理能力的遥感模型提供了标准化基础。项目页面已公开可用。

关键词

引用

@article{arxiv.2511.16853,
  title  = {Towards Unified Vision Language Models for Forest Ecological Analysis in Earth Observation},
  author = {Xizhe Xue and Xiao Xiang Zhu},
  journal= {arXiv preprint arXiv:2511.16853},
  year   = {2025}
}

备注

AAAI2026 AI for Environmental Science Workshop