一种用于学习全切片表示的自监督框架
计算机视觉与模式识别
2024-05-27 v2 人工智能
机器学习
摘要
全切片成像对生物医学显微成像和计算病理学至关重要。此前,针对千兆像素级全切片图像 (WSIs) 的表示学习依赖于带有弱标签的多示例学习,这些弱标签未能标注 WSIs 中多样的形态学特征和空间异质性。一种针对 WSIs 的高质量自监督学习方法将为下游计算病理学任务提供可迁移的视觉表示,而无需密集标注。我们提出了用于 WSIs 千兆像素级自监督的 Slide Pre-trained Transformers (SPT)。SPT 将 WSI 图块视为 token,将来自语言和视觉建模的数据转换策略结合到一个通用且统一的框架中,以生成用于自监督预训练的 WSIs 视图。SPT 利用 WSIs 内在的区域异质性、组织学特征变异性和信息冗余来学习高质量的全切片表示。我们在三个生物医学显微成像数据集的五项诊断任务上对 SPT 视觉表示进行了基准测试。SPT 在组织病理学诊断、癌症亚型分型和基因突变预测方面显著优于基线方法。最后,我们证明,当使用现成的、领域内的和基础性图块编码器进行全切片多示例学习时,SPT 能够持续改进全切片表示。
引用
@article{arxiv.2402.06188,
title = {A self-supervised framework for learning whole slide representations},
author = {Xinhai Hou and Cheng Jiang and Akhil Kondepudi and Yiwei Lyu and Asadur Chowdury and Honglak Lee and Todd C. Hollon},
journal= {arXiv preprint arXiv:2402.06188},
year = {2024}
}
备注
26 pages, 11 figures