中文

CPIA数据集:用于自监督学习预训练的综合病理图像分析数据集

图像与视频处理 2023-10-30 v1

摘要

病理图像分析是计算机辅助诊断中的关键领域,深度学习在其中被广泛应用。利用在自然图像上初始化的预训练模型进行迁移学习,已有效提升了下游病理任务性能。然而,缺乏精细的特异性领域病理初始化限制了其潜力。自监督学习(SSL)无需样本级标签即可预训练,极有希望克服标注昂贵的难题。因此,聚焦病理SSL预训练的研究亟需一个类似计算机视觉中ImageNet的综合标准化数据集。本文提出综合病理图像分析(CPIA)数据集,一个融合103个开源数据集并经广泛标准化的大规模SSL预训练数据集。CPIA数据集含21,427,877张标准化图像,覆盖超48个器官/组织与约100种疾病,包括全切片图像(WSIs)与特征感兴趣区域(ROIs)两类主要数据。基于每像素微米数(MPP)的统一分辨率提出四尺度WSI标准化流程,ROIs则人工划分为三尺度。该多尺度数据集在资深病理专家监督下依诊断习惯构建。CPIA数据集促进全面的病理理解并支持模式发现探索。此外,为发布CPIA数据集,专门给出了若干最先进(SOTA)的SSL预训练与下游评估基线。CPIA数据集及基线见https://github.com/zhanglab2021/CPIA_Dataset。

关键词

引用

@article{arxiv.2310.17902,
  title  = {CPIA Dataset: A Comprehensive Pathological Image Analysis Dataset for Self-supervised Learning Pre-training},
  author = {Nan Ying and Yanli Lei and Tianyi Zhang and Shangqing Lyu and Chunhui Li and Sicheng Chen and Zeyu Liu and Yu Zhao and Guanglei Zhang},
  journal= {arXiv preprint arXiv:2310.17902},
  year   = {2023}
}