中文

RS-WorldModel:用于遥感理解与未来场景预测的统一模型

人工智能 2026-03-17 v1

摘要

遥感世界模型旨在解释观察到的变化并预测合理的未来,两者都共享时空先验。然而,现有方法通常分别处理这两个任务,限制了跨任务的迁移。我们提出了RS-WorldModel,这是一个用于遥感的统一世界模型,联合处理时空变化理解和文本引导的未来场景预测,我们构建了RSWBench-1.1M数据集,包含110万个样本,涵盖两项任务的丰富语言注释。RS-WorldModel分为三个阶段进行训练:(1)地理感知生成预训练(GAGP)基于地理和获取元数据进行预测;(2)协同指令调优(SIT)联合训练理解和预测;(3)可验证强化优化(VRO)使用可验证的任务特定奖励来细化输出。在仅使用2B参数的情况下,RS-WorldModel在大多数时空变化问答指标上超越了最大可120倍的开源模型。其在文本引导的未来场景预测中实现了43.13的FID分数,超越了所有开源基线以及闭源的Gemini-2.5-Flash Image(Nano Banana)。

关键词

引用

@article{arxiv.2603.14941,
  title  = {RS-WorldModel: a Unified Model for Remote Sensing Understanding and Future Sense Forecasting},
  author = {Linrui Xu and Zhongan Wang and Fei Shen and Gang Xu and Huiping Zhuang and Ming Li and Haifeng Li},
  journal= {arXiv preprint arXiv:2603.14941},
  year   = {2026}
}