中文

用于组织学图像分析的 Transformer 掩码预训练

计算机视觉与模式识别 2023-04-18 v1

摘要

在数字病理学中,全切片图像(WSIs)广泛用于癌症诊断和预后预测等应用。视觉 transformer 模型最近成为一种有前景的方法,可在保留补丁间空间关系的同时编码 WSIs 的大区域。然而,由于模型参数数量多且标记数据有限,将 transformer 模型应用于 WSIs 仍然具有挑战性。受掩码语言模型的启发,我们提出了一种无需标记数据即可训练 transformer 模型的 pretext 任务来解决此问题。我们的模型 MaskHIT 使用 transformer 输出重建被掩码的补丁,并基于其位置和视觉特征学习代表性的组织学特征。实验结果表明,MaskHIT 在生存预测和癌症亚型分类任务上分别超越各种多实例学习方法 3% 和 2%。此外,MaskHIT 还优于两种最新的最先进基于 transformer 的方法。最后,MaskHIT 模型生成的注意力图与病理学家的标注之间的比较表明,该模型能在每项任务中准确识别临床相关的组织学结构。

关键词

引用

@article{arxiv.2304.07434,
  title  = {Masked Pre-Training of Transformers for Histology Image Analysis},
  author = {Shuai Jiang and Liesbeth Hondelink and Arief A. Suriawinata and Saeed Hassanpour},
  journal= {arXiv preprint arXiv:2304.07434},
  year   = {2023}
}