RemoteShield:为地球观测任务构建鲁棒的多模态大语言模型
计算机视觉与模式识别
2026-04-21 v1
摘要
面向地球观测任务的鲁棒多模态大语言模型(MLLM)应能够在现实输入变化下保持一致的解释与推理能力。然而,当前遥感多模态大语言模型未能满足这一要求。它们在精心筛选的干净数据集上训练,学习的映射关系对噪声条件下的实际应用缺乏鲁性,导致在部署时面对不完美输入时性能下降。为量化这一脆弱性,我们构建了一套符合现实情境的多模态扰动集合,包括视觉降解(如云层与雾霾)以及从口语化表达到模糊或省略指令的多样化人类语言变体。经验评估表明,这些扰动显著削弱了领先遥感基础模型的视觉-语义推理能力。为此,我们提出RemoteShield——一种在现实输入变体下仍能保持一致输出的鲁棒遥感MLLM。在训练过程中,每个干净样本与其图像-文本扰动变体配对形成语义等价簇。RemoteShield通过在同一簇内对干净条件与扰动条件进行偏好学习进行优化,而非直接拟合噪声样本。通过比较模型对干净输入与损坏输入的响应,模型被鼓励在扰动引起的错误之外,更倾向于选择稳定的响应。这种跨条件对齐有助于模型在视觉降解与文本噪声干扰下,仍能聚焦于底层任务语义。在三个地球观测任务上的实验表明,RemoteShield在现实多模态扰动下, consistently 地展现出优于代表性基线的更强鲁棒性与跨条件一致性。
引用
@article{arxiv.2604.17243,
title = {RemoteShield: Enable Robust Multimodal Large Language Models for Earth Observation},
author = {Rui Min and Liang Yao and Shiyu Miao and Shengxiang Xu and Yuxuan Liu and Chuanyi Zhang and Shimin Di and Fan Liu},
journal= {arXiv preprint arXiv:2604.17243},
year = {2026}
}