基于可验证奖励的卫星图像少样本视觉语言推理
计算机视觉与模式识别
2025-08-08 v2
摘要
近期大型语言和视觉语言模型的进展使其具备强大的推理能力,但在数据稀缺且昂贵的专业领域(如遥感领域)仍不实用。我们提出了第一个针对卫星图像的少样本可验证奖励强化学习(RLVR)框架,无需图像描述监督,仅依赖轻量级基于规则的二元或 IoU 奖励。我们采用语言模型中的“1-shot RLVR”范式适用于视觉语言模型,采用策略梯度优化,仅需一个精选示例即可对齐卫星推理任务的模型输出。在多个遥感基准测试上进行了全面实验,包括分类、视觉问答和定位任务——即使仅一个示例也能显著优于基础模型。扩展到 128 个示例即可匹配或超越在数千个标注样本上训练的模型。尽管极端的 1-shot 设置可能导致轻微的任务特定过拟合,但我们的 метод在 diverse 任务上始终表现出稳健的泛化能力和效率。进一步地,我们发现提示设计和损失加权显著影响训练稳定性和最终准确率。我们的方法实现了成本效益高且数据高效的专业视觉语言推理模型开发,为数据稀缺领域提供了一个务实的配方:从紧凑的 VLM 开始,精选一组可验证奖励的案例,通过 RLVR 进行训练。
引用
@article{arxiv.2507.21745,
title = {Few-Shot Vision-Language Reasoning for Satellite Imagery via Verifiable Rewards},
author = {Aybora Koksal and A. Aydin Alatan},
journal= {arXiv preprint arXiv:2507.21745},
year = {2025}
}
备注
ICCV 2025 Workshop on Curated Data for Efficient Learning (CDEL). 10 pages, 3 figures, 6 tables. Our model, training code and dataset will be at https://github.com/aybora/FewShotReasoning