中文

AMIGO:用于十亿像素图像表示学习的具有共享上下文处理的稀疏多模态图 Transformer

计算机视觉与模式识别 2023-07-06 v2

摘要

处理十亿像素全切片组织病理学图像(WSI)是一项计算代价高昂的任务。多示例学习(MIL)已成为处理 WSI 的常规方法,其中这些图像被分割为更小的图块以进行进一步处理。然而,基于 MIL 的技术忽略了图块内单个细胞的显式信息。在本文中,通过定义共享上下文处理这一新概念,我们设计了一个多模态图 Transformer(AMIGO),它利用组织内的细胞图为患者提供单一表示,同时利用组织的层次结构,实现在细胞级和组织级信息之间的动态聚焦。我们将我们模型的性能与生存预测中的多种最先进方法进行了基准比较,结果表明我们的模型可显著优于所有方法,包括分层视觉 Transformer(ViT)。更重要的是,我们展示了我们的模型对缺失信息具有极强的鲁棒性,以至于仅使用低至 20% 的数据即可达到相同性能。最后,在两个不同的癌症数据集中,我们证明了我们的模型能够将患者分层为低风险和高风险组,而其他最先进方法未能实现这一目标。我们还发布了一个大型免疫组织化学图像数据集(InUIT),包含来自 188 名患者的 1,600 个组织微阵列(TMA)核心及其生存信息,使其成为该背景下最大的公开可用数据集之一。

关键词

引用

@article{arxiv.2303.00865,
  title  = {AMIGO: Sparse Multi-Modal Graph Transformer with Shared-Context Processing for Representation Learning of Giga-pixel Images},
  author = {Ramin Nakhli and Puria Azadi Moghadam and Haoyang Mi and Hossein Farahani and Alexander Baras and Blake Gilks and Ali Bashashati},
  journal= {arXiv preprint arXiv:2303.00865},
  year   = {2023}
}

备注

Accepted at CVPR 2023