中文

PanNuke 数据集扩展、洞见与基线

图像与视频处理 2020-04-23 v7 计算机视觉与模式识别 定量方法

摘要

新兴的计算病理学(CPath)领域因癌组织切片全切片图像(WSI)中原始像素数据的海量规模,成为深度学习(DL)方法应用于医疗健康的沃土。然而,依赖细胞核级细节的 DL 算法必须能够应对来自“临床真实环境”的数据,而这往往相当具有挑战性。我们研究并扩展了近期发布的 PanNuke 数据集,其包含约 200,000 个被归类为 5 个临床重要类别的细胞核,用于 WSI 中细胞核分割与分类这一挑战性任务。先前的泛癌数据集仅包含至多 9 种不同组织、至多 21,000 个未标注细胞核以及刚过 24,000 个带分割掩码的标注细胞核。PanNuke 包含 19 种不同组织类型,由临床病理医生半自动标注并质量控制,从而得到一个统计特性近似临床真实环境且选择偏倚最小的数据集。我们研究了分割与分类模型在所提数据集上的表现,并展示了在 PanNuke 上训练的模型应用于全切片图像的情况。我们提供关于该数据集的全面统计信息,并概述建议与研究方向,以应对现有 DL 工具应用于真实世界 CPath 时的局限。

关键词

引用

@article{arxiv.2003.10778,
  title  = {PanNuke Dataset Extension, Insights and Baselines},
  author = {Jevgenij Gamper and Navid Alemi Koohbanani and Ksenija Benes and Simon Graham and Mostafa Jahanifar and Syed Ali Khurram and Ayesha Azam and Katherine Hewitt and Nasir Rajpoot},
  journal= {arXiv preprint arXiv:2003.10778},
  year   = {2020}
}

备注

Work in progress