UKBOB:17.9 万 MRI 3D 样本,13.7 亿标签掩模的大规模医学图像分割基准数据集
计算机视觉与模式识别
2025-04-10 v1 机器学习
摘要
在医学影像领域,主要挑战在于由于隐私 concerns、后勤因素以及高昂的标注成本,难以收集大规模标注数据。本文提出了英国生物数据库器官与骨骼(UKBOB)数据集,是目前规模最大的身体器官标注数据集,包含 51,761 个 MRI 3D 样本(相当于 1790 万 2D 图像),以及超过 13.7 亿个 72 种器官的 2D 分割掩模,全部基于英国生物数据库 MRI 数据集。我们利用自动标注技术,引入基于器官特定滤波器的自动标注清洗流程,并对 300 例 MRI 进行 11 种腹部类别的手动标注,以验证标签质量(称为 UKBOB-manual)。这种方法允许在保持标签可信度的同时扩展数据集规模。我们进一步通过在过滤后的 UKBOB 上演示训练模型对其他小规模标注数据集(如腹部 MRI)进行零样本泛化,确认了标签的有效性。为进一步减轻噪声标签的影响,我们提出了一种新方法称为熵测试时适应(ETTA),用于细化分割输出。我们使用 UKBOB 在基于 Swin-UNetr 架构的 3D 医学图像分割任务中训练了一个基础模型 Swin-BOB,在 3D 医学影像领域的多个基准测试中实现了最先进的结果,包括 BRATS 大脑 MRI 肿瘤挑战赛(提升 0.4%)和 BTCV 腹部 CT 扫描基准测试(提升 1.3%)。预训练模型和代码已提供,过滤后的标签将随英国生物数据库一同公开。
引用
@article{arxiv.2504.06908,
title = {UKBOB: One Billion MRI Labeled Masks for Generalizable 3D Medical Image Segmentation},
author = {Emmanuelle Bourigault and Amir Jamaludin and Abdullah Hamdi},
journal= {arXiv preprint arXiv:2504.06908},
year = {2025}
}
备注
preprint