遥感持续视觉语言学习:基准测试与分析
计算机视觉与模式识别
2026-04-02 v1
摘要
当前的遥感视觉语言模型(RS VLM)在图像解释方面展示了令人印象深刻的性能,但依赖静态训练数据,限制了其适应持续出现的新感知模态和下游任务的能力。这暴露了一个基本挑战:使RS VLM能够在不发生灾难性遗忘的情况下持续适应。尽管其实际重要性,RS VLM的持续学习能力仍未被充分探索,且目前尚无专用基准。在这项工作中,我们提出了CLeaRS,一个用于遥感持续视觉语言学习的全面基准。CLeaRS包含10个精心策划的子集和超过207k图像-文本对,涵盖多样化的解释任务、感知模态和应用场景。我们进一步定义了三种评估协议:长时序、模态增量和任务增量设置,以系统评估持续适应。对多样化视觉语言模型的广泛基准测试揭示了所有设置下的灾难性遗忘。此外,代表性的持续学习方法在适配到RS VLM时,在处理任务、指令和模态转换方面表现出有限的有效性。我们的发现强调了开发针对RS VLM的持续学习方法的必要性。
引用
@article{arxiv.2604.00820,
title = {Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis},
author = {Xingxing Weng and Ruifeng Ni and Chao Pang and XiangYu Hao and Yishan Wang and Xiaokang Zhang and Wei Xu and Gui-Song Xia},
journal= {arXiv preprint arXiv:2604.00820},
year = {2026}
}
备注
23 pages, 7 figures, 9 tables