通过间接奖励解锁零样本地理空间推理
计算机视觉与模式识别
2026-05-04 v2 人工智能
机器学习
摘要
在稀有领域(如地理空间)训练稳健的推理视觉语言模型(VLMs)受限于监督稀缺。尽管原始地理空间图像丰富,但任务导向的监督数据远不及常见领域。本文验证了一个重要结论:来自看似不相关元数据的间接可验证奖励,足以在广泛的下游任务(25+)中诱导复杂且可泛化的地理空间推理。我们提出了 Geo-R1 作为该范式的一个实证实例。不同于依赖有限任务特定标注(即直接奖励),Geo-R1 利用基于跨视图对齐(地理位置信息)的可扩展、可验证间接代理奖励,以强化学习的方式驱动大规模训练。这种间接奖励成功地激励模型发现并内化零样本地理空间推理,实现在离分布基准上的零样本迁移,甚至在某些基准上超越全监督专家。这些发现表明,针对间接可验证奖励进行优化可能为在拥有大量无标签数据存档的稀有领域解锁通用推理能力提供可扩展的路径。我们的代码可在 https://github.com/miniHuiHui/Geo-R1 获取。
引用
@article{arxiv.2510.00072,
title = {Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards},
author = {Chenhui Xu and Fuxun Yu and Michael J. Bianco and Jacob Kovarskiy and Raphael Tang and Qi Zhang and Zirui Xu and Will LeVine and Brandon Dubbs and Heming Liao and Cassandra Burgess and Suvam Bag and Jay Patravali and Rupanjali Kukal and Mikael Figueroa and Rishi Madhok and Nikolaos Karianakis and Jinjun Xiong},
journal= {arXiv preprint arXiv:2510.00072},
year = {2026}
}
备注
ICML 2026