增强特征多样性提升通道自适应视觉转换器
计算机视觉与模式识别
2024-10-29 v2 人工智能
摘要
多通道成像(MCI)包含一系列用于编码不在传统图像中存在的有用特征表示的挑战。例如,两个不同卫星的图像都包含RGB通道,但剩余通道对每个成像来源而言可能不同。因此,MCI模型必须支持测试时的多种通道配置。最近的工作扩展了传统视觉编码器以适应MCI,如视觉转换器(ViT),通过补充表示通道配置的编码来增强像素信息。然而,这些方法将每个通道平等对待,即不考虑每种通道类型的独特属性,这会导致不必要且可能有害的冗余特征。例如,如果RGB通道始终存在,其他通道可以专注于提取RGB通道无法捕获的信息。为此,我们提出DiChaViT,旨在增强MCI-ViT模型所学习特征的多样性。通过一种新颖的通道抽样策略鼓励选择更多distinct的通道集合进行训练。此外,我们采用正则化和初始化技术以增加从每个通道学习新信息的可能性。许多改进措施与架构无关,可纳入开发新架构时。在卫星图像和细胞显微镜数据集(CHAMMI、JUMP-CP、So2Sat)上实验报告,DiChaViT相较于现有方法可获得1.5%-5.0%的提升。我们的代码已公开于https://github.com/chaudatascience/diverse_channel_vit。
引用
@article{arxiv.2405.16419,
title = {Enhancing Feature Diversity Boosts Channel-Adaptive Vision Transformers},
author = {Chau Pham and Bryan A. Plummer},
journal= {arXiv preprint arXiv:2405.16419},
year = {2024}
}
备注
Accepted to NeurIPS 2024