用于训练和基准测试乳腺癌 H&E 切片分割的多中心数据集
定量方法
2025-10-03 v1 计算机视觉与模式识别
图像与视频处理
摘要
对全切片图像(WSIs)染色于半胱氨酸和碘的乳腺癌进行自动语义分割是大规模人工智能生物标志物分析在乳腺癌中至关重要的任务。然而,现有的公开数据集缺乏所需的形态多样性,以支持模型的通用性和跨异质患者队列的稳健生物标志物验证。我们介绍 BrEast cancEr hisTopathoLogy sEgmentation(BEETLE),这是一个用于 H&E 染色乳腺癌 WSIs 多类语义分割的数据集。该数据集由三家合作临床中心和两套公开数据集提供,采用七台扫描仪进行数字化,覆盖所有分子亚型和组织学分级。通过多样化的注释策略,我们收集了四类注释——侵入性上皮、非侵入性上皮、坏死和其他——特别关注在现有数据集中所缺乏的形态,如乳头状癌症样惊性增生和散在腺癌细胞。该数据集的多样性和与快速增长的乳腺癌自动生物标志物定量领域的相关性,确保了其高度的可重用性。最后,我们提供了一个经过严格整理的多中心外部评估集,以启用乳腺癌分割模型的标准化基准测试。
引用
@article{arxiv.2510.02037,
title = {A Multicentric Dataset for Training and Benchmarking Breast Cancer Segmentation in H&E Slides},
author = {Carlijn Lems and Leslie Tessier and John-Melle Bokhorst and Mart van Rijthoven and Witali Aswolinskiy and Matteo Pozzi and Natalie Klubickova and Suzanne Dintzis and Michela Campora and Maschenka Balkenhol and Peter Bult and Joey Spronck and Thomas Detone and Mattia Barbareschi and Enrico Munari and Giuseppe Bogina and Jelle Wesseling and Esther H. Lips and Francesco Ciompi and Frédérique Meeuwsen and Jeroen van der Laak},
journal= {arXiv preprint arXiv:2510.02037},
year = {2025}
}
备注
Our dataset is available at https://zenodo.org/records/16812932 , our code is available at https://github.com/DIAGNijmegen/beetle , and our benchmark is available at https://beetle.grand-challenge.org/