面向卫星图像的仪照增强型大语言模型对齐的谱系精炼表示
计算机视觉与模式识别
2026-02-27 v1
摘要
视觉语言基础模型(VLFMs)承诺实现对地球观测的零样态和检索理解。尽管运营中的卫星系统常缺乏完整的多光谱覆盖,使得仅使用RGB进行推理在可扩展部署方面极具吸引力,但VLFMs在卫星图像上的应用仍受制于两个因素:(1)多光谱输入信息丰富但难以一致利用,由于波段冗余和错位;(2)CLIP式文本编码器限制了语义表达能力,削弱了细粒度对齐。我们提出SATtxt,这是一个兼具谱系感知的VLFMs,推理时仅使用RGB输入,同时保留训练期间学习到的光谱线索。我们的框架包含两个阶段:首先,通过轻量级投影器将多光谱教师的光谱先验蒸馏到仅使用RGB的学生网络中;其次,利用仪照增强型大语言模型构建谱系驻留对齐,桥接蒸馏后的视觉空间与富有表达力的LLM嵌入空间。跨越EuroSAT、BigEarthNet和ForestNet,SATtxt在零样态分类上平均提升4.2%,检索提升5.9%,线性探针提升2.7%,显示了一条高效通向地球观测中谱系感知视觉语言学习之路。项目页面:https://ikhado.github.io/sattxt/
引用
@article{arxiv.2602.22613,
title = {Spectrally Distilled Representations Aligned with Instruction-Augmented LLMs for Satellite Imagery},
author = {Minh Kha Do and Wei Xiang and Kang Han and Di Wu and Khoa Phan and Yi-Ping Phoebe Chen and Gaowen Liu and Ramana Rao Kompella},
journal= {arXiv preprint arXiv:2602.22613},
year = {2026}
}