中文

通道视觉变换器:一幅图像相当于 1×16×16 个词

计算机视觉与模式识别 2024-04-22 v4 人工智能 机器学习

摘要

Vision Transformer (ViT) 已成为现代计算机视觉领域中一种强大的架构。然而,其在某些成像领域(如显微镜和卫星成像)中的应用带来了独特挑战。在这些领域中,图像通常包含多个通道,每个通道承载语义上不同且独立的信息。此外,模型必须对输入通道中的稀疏性具有鲁棒性,因为它们在训练或测试期间可能无法密集可用。在本文中,我们提出对 ViT 架构的一种修正,以增强跨输入通道的推理,并引入分层通道采样(HCS)作为一种额外的正则化技术,以确保仅在测试时呈现部分通道时的鲁棒性。我们提出的模型 ChannelViT 独立地从每个输入通道构建块令牌,并利用可学习的通道嵌入添加到块令牌上,类似于位置嵌入。我们在 ImageNet、JUMP-CP(显微镜细胞成像)和 So2Sat(卫星成像)上评估了 ChannelViT 的性能。我们的结果表明,ChannelViT 在分类任务上优于 ViT,并且即使测试时仅使用输入通道的子集也具有良好的泛化能力。在我们的实验中,HCS 被证明是一种强大的正则化器,与所采用的架构无关,表明其作为一种鲁棒 ViT 训练的简便技术。最后,我们发现 ChannelViT 即使在训练期间对所有通道的访问有限时也能有效泛化,突出了其在具有稀疏传感器的真实条件下多通道成像的潜力。我们的代码可在 https://github.com/insitro/ChannelViT 获取。

关键词

引用

@article{arxiv.2309.16108,
  title  = {Channel Vision Transformers: An Image Is Worth 1 x 16 x 16 Words},
  author = {Yujia Bao and Srinivasan Sivanandan and Theofanis Karaletsos},
  journal= {arXiv preprint arXiv:2309.16108},
  year   = {2024}
}