DynamicVis:面向高效遥感基础模型的动态视觉感知
计算机视觉与模式识别
2026-03-20 v2
摘要
遥感(RS)技术的进步实现了高分辨率地球观测;然而,使用现代视觉基础模型(VFMs)解释这些图像仍然是一个重大挑战。与以物体为中心的自然图像不同,RS 图像的根本特征在于极端的目标稀疏性和巨大的空间冗余。关键目标物体(如船舶、车辆)通常占据不到 1% 的空间范围,被广阔的无目标背景所包围。现有的 VFMs 主要依赖均匀的密集处理(如 ViTs)和像素重建预训练范式(如 MAE)。这些方法在建模冗余背景时固有地浪费了大量计算能力,并无意中稀释了小而稀疏目标的特征表示。为了弥合这种结构性错位,我们提出了 DynamicVis,一种明确针对 RS 图像稀疏特性量身定制的视觉基础模型。在架构上,DynamicVis 引入了 Dynamic Region-Aware SSM,绕过了均匀计算。它自适应地路由并仅增量建模与任务相关的高显著性 token,同时对背景上下文采用无参数整合,大幅降低了处理超长 2D token 序列(100,000)的复杂度。至关重要的是,为了赋予网络鲁棒的空间选择能力,我们提出了一种新颖的区域级元嵌入多示例学习(MIL)预训练范式。在百万规模数据集上训练后,该范式在潜在语义空间中显式地将稀疏前景实例与密集背景解耦,克服了传统像素重建方法的语义模糊性。在九个不同下游任务上的广泛评估表明,DynamicVis 展现出卓越的效能,尤其在稀疏目标和实例级感知任务(如小目标检测和变化检测)中占据主导地位。
引用
@article{arxiv.2503.16426,
title = {DynamicVis: Dynamic Visual Perception for Efficient Remote Sensing Foundation Models},
author = {Keyan Chen and Chenyang Liu and Bowen Chen and Wenyuan Li and Zhengxia Zou and Shijian Lu and Zhenwei Shi},
journal= {arXiv preprint arXiv:2503.16426},
year = {2026}
}