多模态信息 ViT:高光谱与 LiDAR 分类的信息聚合与分布
计算机视觉与模式识别
2024-01-24 v2
摘要
在多模态土地覆盖分类 (MLCC) 中,一个常见的挑战是数据分布中的冗余,来自多种模态的不相关信息可能阻碍其独特特征的有效整合。为解决这一问题,我们引入了多模态信息 ViT (MIVit),这是一种具有创新信息聚合 - 分布机制的系统。该方法重新定义了冗余水平,并将性能感知元素整合到融合表示中,促进了前向和后向的语义学习。MIVit 的突出特点在于显著减少了每种模态单独及融合特征的经验分布中的冗余。它采用定向注意力融合 (OAF) 在水平和垂直维度上提取跨模态的浅层局部特征,并利用 Transformer 特征提取器通过长程注意力提取深层全局特征。我们还提出了一种基于互信息的信息聚合约束 (IAC),旨在去除嵌入特征中的冗余信息并保留互补信息。此外,MIVit 中的信息分布流 (IDF) 通过将全局分类信息分布到不同模态的特征图上,增强了性能感知能力。该架构还通过轻量级独立模态分类器解决了缺失模态的挑战,降低了通常与 Transformer 相关的计算负载。结果表明,MIVit 在模态间的双向聚合 - 分布机制非常有效,在三个多模态数据集上实现了 95.56% 的平均总体准确率。这一性能超越了当前 MLCC 领域的最先进方法。MIVit 的代码可在 https://github.com/icey-zhang/MIViT 获取。
引用
@article{arxiv.2401.03179,
title = {Multimodal Informative ViT: Information Aggregation and Distribution for Hyperspectral and LiDAR Classification},
author = {Jiaqing Zhang and Jie Lei and Weiying Xie and Geng Yang and Daixun Li and Yunsong Li},
journal= {arXiv preprint arXiv:2401.03179},
year = {2024}
}