基于干预稳定特征学习的多模态图像融合
计算机视觉与模式识别
2026-03-25 v1 多媒体
摘要
多模态图像融合将不同模态中的互补信息整合到统一表示中。现有方法主要优化模态间的统计相关性,往往捕获数据集诱导的虚假关联,这些关联在分布偏移下会退化。在本文中,我们提出一个受因果原理启发的干预框架,以识别鲁棒的跨模态依赖。借鉴 Pearl 的因果层次,我们设计了三种原则性的干预策略来探测模态关系的不同方面:i) 互补掩码结合空间不交扰动,测试模态能否真正补偿彼此缺失的信息;ii) 相同区域的随机掩码,识别在部分可观测下仍保持信息量的特征子集;iii) 模态丢弃评估每种模态不可替代的贡献。基于这些干预,我们引入因果特征整合器 (CFI),通过自适应不变性门控学习识别和优先排序在不同扰动模式下保持重要性的干预稳定特征,从而捕获鲁棒的模态依赖而非虚假相关。大量实验表明,我们的方法在公共基准和下游高层视觉任务上均达到 SOTA 性能。
引用
@article{arxiv.2603.23272,
title = {Multi-Modal Image Fusion via Intervention-Stable Feature Learning},
author = {Xue Wang and Zheng Guan and Wenhua Qian and Chengchao Wang and Runzhuo Ma},
journal= {arXiv preprint arXiv:2603.23272},
year = {2026}
}
备注
Accpted by CVPR 2026