孤立通道视觉 Transformer:从单通道预训练到多通道微调
计算机视觉与模式识别
2025-10-14 v2
摘要
视觉 Transformer(ViT)在标准 RGB 图像处理任务中取得了显著的成功。然而,将 ViT 应用于多通道成像(MCI)数据(如医疗和遥感应用)仍是一个挑战。特别是,MCI 数据通常由来自不同模态的层组成。直接在此类数据上训练 ViT 可能模糊互补信息并损害性能。本文提出一种简单有效的大规模 MCI 数据集预训练框架。我们称之为孤立通道 ViT(IC-ViT),对图像的各个通道进行 patch 化,从而实现多模态多通道任务的预训练。我们表明,这种通道级 patch 化是 MCI 处理的关键技术。更重要的是,可以在单个通道上预训练 IC-ViT 并在下游多通道数据集上微调。该预训练框架捕获 patch 之间的依赖关系以及通道之间的依赖关系,产生稳健的特征表示。在包括 JUMP-CP 和 CHAMMI 用于细胞显微成像,以及 So2Sat-LCZ42 用于卫星成像的各种任务和基准测试上进行实验,结果表明所提出的 IC-ViT 在现有通道自适应方法之上交付 4-14 个百分点的性能提升。此外,其高效训练使其成为在异构数据上大规模预训练基础模型的合适候选。我们的代码已公开于 https://github.com/shermanlian/IC-ViT。
关键词
引用
@article{arxiv.2503.09826,
title = {Isolated Channel Vision Transformers: From Single-Channel Pretraining to Multi-Channel Finetuning},
author = {Wenyi Lian and Patrick Micke and Joakim Lindblad and Nataša Sladoje},
journal= {arXiv preprint arXiv:2503.09826},
year = {2025}
}
备注
Paper has been accepted by BMVC as an Oral presentation