语言模型亦是良医:利用基于注意力的序列压缩与文本预训练 Transformer 实现高效 WSI 分类
计算机视觉与模式识别
2023-10-03 v2
摘要
在数字病理学中,全切片图像(WSI)分析通常被表述为多示例学习(MIL)问题。尽管基于 transformer 的架构已用于 WSI 分类,这些方法需经修改以适应此类图像数据的特定挑战。其中一项挑战是深度 transformer 模型处理长输入(如以 或 放大倍率构成 WSI 的数千图像块)所需的内存与计算量。我们引入了 \textit{SeqShort},一种基于多头注意力的序列缩短层,将每个 WSI 概括为固定且短尺寸的实例序列,使我们能降低长序列上自注意力的计算成本,并纳入其他 MIL 方法所缺失的位置信息。此外,我们表明当下游客 transformer 架构已在大型文本语料库上预训练、且仅微调其少于 0.1% 的参数时,WSI 分类性能可获提升。我们在淋巴结转移分类与癌症亚型分类任务中证明了方法的有效性,无需设计 WSI 专用 transformer 或做领域内预训练,并保持精简的计算预算与少量可训练参数。
引用
@article{arxiv.2211.07384,
title = {Language models are good pathologists: using attention-based sequence reduction and text-pretrained transformers for efficient WSI classification},
author = {Juan I. Pisula and Katarzyna Bozek},
journal= {arXiv preprint arXiv:2211.07384},
year = {2023}
}