全切片图像分类:什么才是关键?
计算机视觉与模式识别
2023-10-06 v1
摘要
近来涌现出许多用于分类极高分辨率全切片图像(WSI)的算法。这些新算法大多聚焦于寻找新颖的方式以组合从切片中提取的小局部块的信息,着重于有效聚合更全局的信息用于最终预测器。本文我们深入探究 WSI 分类算法的不同关键设计选择,以考察对实现高准确率而言什么最为重要。令人惊讶的是,我们发现捕获全局上下文信息未必意味着更好的性能。一个捕获最全局信息的模型始终比捕获较少全局信息的模型表现更差。此外,一个不捕获任何全局信息的极简多示例学习方法,其表现几乎与捕获大量全局信息的模型相当。这些结果表明,有效 WSI 分类的最重要的特征是在局部小块层面捕获的,此处细胞与组织微环境细节最为显著。另一令人惊讶的发现是,在包含 33 种癌症的更大数据集上的无监督预训练,相比在较小的 7 种癌症(含目标癌症)数据集上的预训练,性能显著更差。我们假定,在更小且更聚焦的数据集上预训练,可使特征提取器更好地利用有限特征空间以更好区分输入块中的细微差异。
引用
@article{arxiv.2310.03279,
title = {Classifying Whole Slide Images: What Matters?},
author = {Long Nguyen and Aiden Nibali and Joshua Millward and Zhen He},
journal= {arXiv preprint arXiv:2310.03279},
year = {2023}
}