通道视觉变换器:一幅图像相当于 1×16×16 个词
计算机视觉与模式识别
2024-04-22 v4 人工智能
机器学习
摘要
Vision Transformer (ViT) 已成为现代计算机视觉领域中一种强大的架构。然而,其在某些成像领域(如显微镜和卫星成像)中的应用带来了独特挑战。在这些领域中,图像通常包含多个通道,每个通道承载语义上不同且独立的信息。此外,模型必须对输入通道中的稀疏性具有鲁棒性,因为它们在训练或测试期间可能无法密集可用。在本文中,我们提出对 ViT 架构的一种修正,以增强跨输入通道的推理,并引入分层通道采样(HCS)作为一种额外的正则化技术,以确保仅在测试时呈现部分通道时的鲁棒性。我们提出的模型 ChannelViT 独立地从每个输入通道构建块令牌,并利用可学习的通道嵌入添加到块令牌上,类似于位置嵌入。我们在 ImageNet、JUMP-CP(显微镜细胞成像)和 So2Sat(卫星成像)上评估了 ChannelViT 的性能。我们的结果表明,ChannelViT 在分类任务上优于 ViT,并且即使测试时仅使用输入通道的子集也具有良好的泛化能力。在我们的实验中,HCS 被证明是一种强大的正则化器,与所采用的架构无关,表明其作为一种鲁棒 ViT 训练的简便技术。最后,我们发现 ChannelViT 即使在训练期间对所有通道的访问有限时也能有效泛化,突出了其在具有稀疏传感器的真实条件下多通道成像的潜力。我们的代码可在 https://github.com/insitro/ChannelViT 获取。
引用
@article{arxiv.2309.16108,
title = {Channel Vision Transformers: An Image Is Worth 1 x 16 x 16 Words},
author = {Yujia Bao and Srinivasan Sivanandan and Theofanis Karaletsos},
journal= {arXiv preprint arXiv:2309.16108},
year = {2024}
}