中文

ChA-MAEViT:统一通道感知掩码自编码器与多通道视觉Transformer以提升跨通道学习

计算机视觉与模式识别 2025-10-28 v3 机器学习

摘要

先前使用掩码自编码器 (MAE) 的工作通常依赖基于图像在不同通道间显著冗余性假设的随机块遮蔽,认为可利用跨通道相关性重建被遮盖内容。然而,这一假设在多通道成像 (MCI) 中不成立,因为各通道可能提供互补信息且特征重叠最小。因此,这些 MAE 主要从块重建中学习单个通道的局部结构,无法充分利用跨通道相互作用,限制了其在 MCI 中的有效性。本文提出 ChA-MAEViT,一种基于 MAE 的方法,通过四大策略提升 MCI 通道间特征学习:(1) 动态通道-块遮蔽,迫使模型在遮蔽块之外重建缺失通道,从而增强跨通道依赖并提升对不同通道配置的鲁棒性;(2) 记忆 token,作为长期记忆辅助,促进跨通道信息共享,解决重建结构多样通道的挑战;(3) 混合 token 融合模块,整合细粒度块 token 与全局类别 token,以捕获更丰富的表征;(4) 通道感知解码器,轻量化解码器利用通道 token 有效重建图像块。在卫星图像和显微镜数据集 CHAMMI、JUMP-CP、So2Sat 上的实验表明,ChA-MAEViT 对比最新 MCI-ViT 性能提升 3.0-21.5%,凸显跨通道相互作用在 MCI 中之重要性。我们的代码公开于 https://github.com/chaudatascience/cha_mae_vit。

关键词

引用

@article{arxiv.2503.19331,
  title  = {ChA-MAEViT: Unifying Channel-Aware Masked Autoencoders and Multi-Channel Vision Transformers for Improved Cross-Channel Learning},
  author = {Chau Pham and Juan C. Caicedo and Bryan A. Plummer},
  journal= {arXiv preprint arXiv:2503.19331},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025