通过条件化和退化掩码自编码器应对异构多模态图像联合预训练
计算机视觉与模式识别
2026-04-21 v1
摘要
在多模态视觉中,跨极度异构模态学习鲁棒表征仍是根本性挑战。作为这一挑战的关键且深刻的实例,高分辨率(HR)联合光学和合成孔径雷达(SAR)预训练寻求模态协同效应,以相互增强单源表征;其潜力严重受制于异构分辨率悖论:更细的空间尺度极大放大了复杂雷达几何与非同构光学纹理之间的物理差异。因此,将面向中分辨率的刚性对齐范式迁移到 HR 场景会导致要么严重抑制特征以强制等效,要么受极端认识不确定性驱动的特征污染。两种极端最终导致深刻的表征退化和负迁移。为克服这一瓶颈,我们提出 CoDe-MAE,开创“更少对齐但更佳协同”的哲学。首先,光学锚定知识蒸馏(OKD)通过将其映射到纯语义流形来隐式正则化 SAR 的斑点噪声。基于此,条件对比学习(CCL)利用梯度缓冲机制对齐共享共识,同时安全保留差异的物理特征。同时,跨模态退化重建(CDR)刻意削弱非同构的谱系伪特征,截断本质上不适定的映射以捕获真实结构不变量。广泛的分析验证了我们的理论主张。在 100 万样本上预训练,CoDe-MAE 展示了显著的数据效率,成功防止了表征退化,并在多样化的单模态和双模态下游任务中建立了新的领先性能,显著优于在 vastly 更大数据集上规模化的基础模型。
引用
@article{arxiv.2604.16952,
title = {Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder},
author = {Bowen Peng and Yongxiang Liu and Jie Zhou and Xiaodong Chen and Tianpeng Liu and Xiaogang Yu and Li Liu},
journal= {arXiv preprint arXiv:2604.16952},
year = {2026}
}