RS-WorldModel:用于遥感理解与未来场景预测的统一模型
人工智能
2026-03-17 v1
摘要
遥感世界模型旨在解释观察到的变化并预测合理的未来,两者都共享时空先验。然而,现有方法通常分别处理这两个任务,限制了跨任务的迁移。我们提出了RS-WorldModel,这是一个用于遥感的统一世界模型,联合处理时空变化理解和文本引导的未来场景预测,我们构建了RSWBench-1.1M数据集,包含110万个样本,涵盖两项任务的丰富语言注释。RS-WorldModel分为三个阶段进行训练:(1)地理感知生成预训练(GAGP)基于地理和获取元数据进行预测;(2)协同指令调优(SIT)联合训练理解和预测;(3)可验证强化优化(VRO)使用可验证的任务特定奖励来细化输出。在仅使用2B参数的情况下,RS-WorldModel在大多数时空变化问答指标上超越了最大可120倍的开源模型。其在文本引导的未来场景预测中实现了43.13的FID分数,超越了所有开源基线以及闭源的Gemini-2.5-Flash Image(Nano Banana)。
关键词
引用
@article{arxiv.2603.14941,
title = {RS-WorldModel: a Unified Model for Remote Sensing Understanding and Future Sense Forecasting},
author = {Linrui Xu and Zhongan Wang and Fei Shen and Gang Xu and Huiping Zhuang and Ming Li and Haifeng Li},
journal= {arXiv preprint arXiv:2603.14941},
year = {2026}
}