中文

REO-VLM:为地球观测中的回归挑战构建的视觉语言模型

计算机视觉与模式识别 2024-12-24 v1

摘要

视觉语言模型(VLM)的快速演进已催化了人工智能领域的显著进展,使其研究扩展到包括地球观测(EO)在内的多个学科。尽管VLMs在EO中增强了图像理解和数据处理,但其应用主要聚焦于图像内容描述,这忽略了其在地理和科学回归任务中的潜力——这些任务对于多样化的EO应用至关重要。为弥合这一差距,本文引入了一个新的基准数据集,称为\textbf{REO-Instruct},用于专为EO领域统一回归和生成任务。该数据集包含160万个多模态EO图像和语言对,旨在支持生物量回归和图像内容解释任务。基于该数据集,我们开发了\textbf{REO-VLM},一种将回归能力无缝集成于传统生成功能的开创性模型。通过利用语言驱动的推理机制纳入科学领域知识,REO-VLM不仅依赖于EO图像,即可从EO数据中对复杂科学属性进行全面解读。该方法建立了新的性能基准,显著提升了环境监测和资源管理的能力。

关键词

引用

@article{arxiv.2412.16583,
  title  = {REO-VLM: Transforming VLM to Meet Regression Challenges in Earth Observation},
  author = {Xizhe Xue and Guoting Wei and Hao Chen and Haokui Zhang and Feng Lin and Chunhua Shen and Xiao Xiang Zhu},
  journal= {arXiv preprint arXiv:2412.16583},
  year   = {2024}
}