中文

用于全切片图像分类的多尺度高效图 Transformer

计算机视觉与模式识别 2023-05-26 v1

摘要

全切片图像(WSIs)中的多尺度信息对癌症诊断至关重要。尽管现有的多尺度视觉 Transformer 在学习多尺度图像表示方面已展现出有效性,但由于 gigapixel(十亿像素)级 WSI 的极大图像尺寸,其仍无法良好工作。为此,我们提出了一种新颖的用于 WSI 分类的多尺度高效图 Transformer(MEGT)框架。MEGT 的核心思想是采用两个独立的基于高效图的 Transformer(EGT)分支分别处理 WSI 的低分辨率与高分辨率图像块嵌入(即 Transformer 中的 token),随后通过多尺度特征融合模块(MFFM)融合这些 token。具体而言,我们设计了 EGT 以高效学习图像块 token 的局部-全局信息,其将图表示集成到 Transformer 中以捕获 WSI 的空间相关信息。同时,我们提出一种新颖的 MFFM 来缓解特征融合过程中不同分辨率图像块间的语义鸿沟,其为每个分支创建一个非图像块 token 作为代理,通过交叉注意力与另一分支交换信息。此外,为加速网络训练,EGT 中开发了新颖的 token 剪枝模块以减少冗余 token。在 TCGA-RCC 和 CAMELYON16 数据集上的大量实验证明了所提 MEGT 的有效性。

关键词

引用

@article{arxiv.2305.15773,
  title  = {Multi-scale Efficient Graph-Transformer for Whole Slide Image Classification},
  author = {Saisai Ding and Juncheng Li and Jun Wang and Shihui Ying and Jun Shi},
  journal= {arXiv preprint arXiv:2305.15773},
  year   = {2023}
}