中文

通过分层自监督学习将视觉 Transformer 扩展至十亿像素图像

计算机视觉与模式识别 2022-06-07 v1

摘要

视觉 Transformer(ViTs)及其多尺度与分层变体已成功用于捕捉图像表示,但其应用通常限于低分辨率图像(如 256x256、384x384)。在计算病理学中,十亿像素全切片成像(WSI)在 20X 放大倍率下可达 150000x150000 像素,并呈现跨不同分辨率的视觉 token 分层结构:从刻画细胞间空间模式的 16x16 图像,到表征组织微环境内相互作用的 4096x4096 图像。我们提出一种称为分层图像金字塔 Transformer(HIPT)的新 ViT 架构,其利用 WSI 固有的自然分层结构,通过两级自监督学习来学习高分辨率图像表示。HIPT 使用 10,678 张十亿像素 WSI、408,218 张 4096x4096 图像和 1.04 亿张 256x256 图像在 33 种癌症类型上进行了预训练。我们在 9 个切片级任务上基准测试 HIPT 表示,并证明:1)具有分层预训练的 HIPT 在癌症亚型分类和生存预测上优于当前最先进(state-of-the-art)方法;2)自监督 ViT 能够建模肿瘤微环境中表型分层结构的重要归纳偏置。

关键词

引用

@article{arxiv.2206.02647,
  title  = {Scaling Vision Transformers to Gigapixel Images via Hierarchical Self-Supervised Learning},
  author = {Richard J. Chen and Chengkuan Chen and Yicong Li and Tiffany Y. Chen and Andrew D. Trister and Rahul G. Krishnan and Faisal Mahmood},
  journal= {arXiv preprint arXiv:2206.02647},
  year   = {2022}
}

备注

Accepted to CVPR 2022 (Oral)