基于隐空间引导的缺失模态下的多模态分割情景抽样
计算机视觉与模式识别
2026-05-21 v1 人工智能
摘要
多模态语义分割通过结合不同传感器模态的互补信息来增强遥感分析。在实际遥感应用中,由于传感器故障、恶劣气象条件或数据获取问题,可能缺少一或多个模态。即便使用预训练的多模态表示和现有的微调或适应策略,性能仍可能受限,因为通常将所有模态可用情景视为等信息。在本文中,我们提出了一种新颖的训练策略,从预训练隐空间中直接学习情景抽样分布。该方法不依赖均匀随机模态丢弃,而是引导微调 toward更具信息性的模态可用情景。具体而言,我们独立基于其在共享隐表示中所引入的扰动来量化每个情景的效果。我们随后使用径向基函数核捕获情景关系,并通过正则化核平滑推导出 refined 情景得分。这些得分随后在情景抽样中用于微调。我们在三个遥感图像数据集(DSTL、Potsdam 和 Hunan)上使用 CBC-SLP、CBC 和 CMX backbone 进行评估。不同图像集和 backbone 的实验结果表明,我们的方法在标准微调和 LoRA 基于适应方面均优于。这些发现表明,预训练隐表示可作为缺失模态微调期间抽样的有效基础。代码地址:https://github.com/iremulku/Latent-Space-Guided-Scenario-Sampling
引用
@article{arxiv.2605.20372,
title = {Latent Space Guided Scenario Sampling for Multimodal Segmentation Under Missing Modalities},
author = {Irem Ulku and Ö. Özgür Tanrıöver and Erdem Akagündüz},
journal= {arXiv preprint arXiv:2605.20372},
year = {2026}
}
备注
14 pages, 4 figures, 9 tables