中文

Atomizer:通过将卫星图像分解为标量集来泛化至新模态

计算机视觉与模式识别 2025-09-10 v2

摘要

对地观测卫星数量的增长导致了日益多样化的遥感数据,具有不同的空间、光谱和时间配置。大多数现有模型依赖固定输入格式和模态特定编码器,当引入新配置时需要重新训练,限制了它们跨模态泛化的能力。我们引入Atomizer,一种灵活架构,将遥感图像表示为标量集合,每个标量对应一个像素的光谱波段值。每个标量附加上下文元数据(采集时间、空间分辨率、波长和带宽),产生一个原子表示,使单个编码器无需插值或重采样即可处理任意模态。Atomizer使用结构化标记化与傅里叶特征和非均匀径向基函数来编码内容和上下文,并通过交叉注意力将标记映射到潜在空间。在模态不交叠评估中,Atomizer优于标准模型,并在不同分辨率和空间尺寸下展现出鲁棒性能。

关键词

引用

@article{arxiv.2506.13542,
  title  = {Atomizer: Generalizing to new modalities by breaking satellite images down to a set of scalars},
  author = {Hugo Riffaud de Turckheim and Sylvain Lobry and Roberto Interdonato and Diego Marcos},
  journal= {arXiv preprint arXiv:2506.13542},
  year   = {2025}
}