中文

ChAda-ViT:面向异质显微图像联合表征学习的通道自适应注意力

计算机视觉与模式识别 2024-06-04 v2 机器学习

摘要

与始终被编码为 RGB 通道的彩色摄影图像不同,生物图像包含多种模态,其中显微镜的类型以及每个通道的含义随每次实验而变化。重要的是,通道数量可从一个到十几个不等,且它们之间的相关性通常远低于 RGB,因为每个通道都带来特定的信息内容。这一方面在很大程度上被生物图像领域之外设计的方法所忽视,当前的解决方案主要聚焦于通道内空间注意力,往往忽略通道之间的关系,而这在大多数生物应用中至关重要。重要的是,可变的通道类型与数量阻碍了将多个实验投影到统一表征以进行大规模预训练。在本研究中,我们提出 ChAda-ViT,一种新颖的通道自适应 Vision Transformer 架构,对任意数量、顺序和类型的通道图像采用通道间注意力机制。我们还引入了 IDRCell100k,一个具有丰富内容的生物图像数据集,包含 79 个实验,覆盖 7 种显微镜模态,具有多种通道类型,且每次实验的通道数从 1 到 10 不等。我们的架构以自监督方式训练,在若干生物学相关的下游任务中优于现有方法。此外,它可首次用于弥合具有不同显微镜、通道数量或类型的检测之间的差距,通过将各种图像与实验模态嵌入统一的生物图像表征中。后者应促进跨学科研究,并为在基于生物图像的分析中更好地采用深度学习铺平道路。代码与数据见 https://github.com/nicoboou/chadavit。

关键词

引用

@article{arxiv.2311.15264,
  title  = {ChAda-ViT : Channel Adaptive Attention for Joint Representation Learning of Heterogeneous Microscopy Images},
  author = {Nicolas Bourriez and Ihab Bendidi and Ethan Cohen and Gabriel Watkinson and Maxime Sanchez and Guillaume Bollot and Auguste Genovesio},
  journal= {arXiv preprint arXiv:2311.15264},
  year   = {2024}
}