RoFormer 用于全切片图像分类中位置感知的多示例学习
计算机视觉与模式识别
2023-10-04 v1 机器学习
摘要
全切片图像(WSI)分类是计算病理学中的关键任务。然而,此类图像的十亿像素级尺寸仍是当前深度学习的主要挑战。现有方法依赖带有冻结特征提取器的多示例学习(MIL)模型。鉴于每幅图像中实例数量巨大,MIL 方法长期假设图像块独立且置换不变,忽视了组织结构和图像块间的相关性。近期工作开始研究实例间这种相关性,但如此大量 token 的计算负荷仍是限制因素。特别地,图像块的相对位置尚未得到解决。我们提出应用一个直接的编码模块,即 RoFormer 层,依赖内存高效的精确自注意力与相对位置编码。该模块可对大型任意形状 WSI 的图像块执行带相对位置编码的完整自注意力,从而解决实例间相关性与组织空间建模的需求。我们证明,在三个常用公开数据集(TCGA-NSCLC、BRACS 和 Camelyon16)的弱监督分类任务上,我们的方法优于最先进的 MIL 模型。代码见 https://github.com/Sanofi-Public/DDS-RoFormerMIL
引用
@article{arxiv.2310.01924,
title = {RoFormer for Position Aware Multiple Instance Learning in Whole Slide Image Classification},
author = {Etienne Pochet and Rami Maroun and Roger Trullo},
journal= {arXiv preprint arXiv:2310.01924},
year = {2023}
}