我们需要多少模型参数?遥感基础模型中的 redundancy 与 slimmability
计算机视觉与模式识别
2026-02-02 v1
摘要
遥感(RS)领域的大规模基础模型(FMs)基于计算机视觉(CV)中建立的范式开发,已在 various Earth观测应用中展现出前景。然而,将CV中的 scaling 假设直接迁移到RS领域,尚未得到充分检视。我们假设,RS基础模型在参数规模远小于其CV对应模型时,就已进入过参数化 regime,此时增加参数数量主要导致的是冗余的表征,而非新的质化抽象。为检验此假设,我们采用后期 slimming(post-hoc slimming)技术,通过统一缩减预训练编码器的宽度,来衡量六个最先进的RS基础模型在四个下游分类任务上的表征冗余度。我们的发现显示出与CV领域显著的对比:而在ImageNet上进行后期 slimming的掩码自编码器(MAE)在降至1% FLOPs后,仅保留不到10%的准确率;相反,RS基础模型在相同算力预算下保持超过71%的相对准确率。这七倍的差异为我们的假设提供了强有力的经验支持。我们进一步展示,通过学习的可 slimmable 训练可以改进基于MoCo和MAE的模型。此外,基于解释方差比和特征相关性分析,我们提供机械性解释,表明RS基础模型在分配任务相关信息时高度存在冗余。我们的发现将后期 slimmability 确立为资源受限环境中的实用部署策略,也是挑战RS中 prevailing scaling paradigm(主流 scaling 范式)的诊断工具。经接受后,我们将发布所有代码。
关键词
引用
@article{arxiv.2601.22841,
title = {How Much of a Model Do We Need? Redundancy and Slimmability in Remote Sensing Foundation Models},
author = {Leonard Hackel and Tom Burgert and Begüm Demir},
journal= {arXiv preprint arXiv:2601.22841},
year = {2026}
}