中文

Lizard: 面向结肠细胞核实例分割与分类的大规模数据集

计算机视觉与模式识别 2021-11-30 v2 机器学习

摘要

计算病理学(CPath)深度分割模型的发展有助于促进可解释形态学生物标志物的研究。然而,此类方法的成功存在一个主要瓶颈,因为监督式深度学习模型需要大量准确标注的数据。这一问题在 CPath 领域尤为严重,因为生成详细标注通常需要病理学家的输入,以区分不同的组织结构和细胞核。手动标注细胞核可能不是收集大规模标注数据集的可行方法,特别是当单个图像区域可能包含数千个不同的细胞时。然而,仅依赖自动生成标注会限制真实标注的准确性与可靠性。因此,为帮助克服上述挑战,我们提出了一种多阶段标注流程,以实现组织学图像分析大规模数据集的收集,并包含病理学家参与的迭代优化步骤。利用该流程,我们生成了已知最大的细胞核实例分割与分类数据集,包含 H&E 染色结肠组织中近五十万个标注细胞核。我们已发布该数据集,并鼓励研究社区利用它来推动 CPath 中下游基于细胞的模型的发展。

关键词

引用

@article{arxiv.2108.11195,
  title  = {Lizard: A Large-Scale Dataset for Colonic Nuclear Instance Segmentation and Classification},
  author = {Simon Graham and Mostafa Jahanifar and Ayesha Azam and Mohammed Nimir and Yee-Wah Tsang and Katherine Dodd and Emily Hero and Harvir Sahota and Atisha Tank and Ksenija Benes and Noorul Wahab and Fayyaz Minhas and Shan E Ahmed Raza and Hesham El Daly and Kishore Gopalakrishnan and David Snead and Nasir Rajpoot},
  journal= {arXiv preprint arXiv:2108.11195},
  year   = {2021}
}