中文

SA-Med2D-20M 数据集:基于两千万掩码的二维医学影像任意分割

图像与视频处理 2023-11-21 v1 计算机视觉与模式识别

摘要

Segment Anything Model(SAM)利用点与边界框等输入提示,在自然图像分割上取得了令人印象深刻的成果。其成功很大程度上归功于海量的标注训练数据。然而,直接将 SAM 应用于医学图像分割表现不佳,因为 SAM 缺乏医学知识——它未使用医学图像进行训练。为将医学知识注入 SAM,我们引入 SA-Med2D-20M,一个基于众多公开与私有数据集构建的大规模二维医学图像分割数据集。它包含 460 万张二维医学图像及相应的 1970 万掩码,覆盖几乎全身并展现出显著的多样性。本文描述了 SA-Med2D-20M 中收集的所有数据集,并详述了如何处理这些数据集。此外,给出了 SA-Med2D-20M 的全面统计信息以促进数据集的更好使用,可帮助研究者构建医学视觉基础模型或将其模型应用于下游医学应用。我们希望 SA-Med2D-20M 的大规模与多样性能被用来发展医学人工智能,以提升诊断、医学图像分析、知识共享与教育。具有再分发许可的数据公开于 https://github.com/OpenGVLab/SAM-Med2D。

关键词

引用

@article{arxiv.2311.11969,
  title  = {SA-Med2D-20M Dataset: Segment Anything in 2D Medical Imaging with 20 Million masks},
  author = {Jin Ye and Junlong Cheng and Jianpin Chen and Zhongying Deng and Tianbin Li and Haoyu Wang and Yanzhou Su and Ziyan Huang and Jilong Chen and Lei Jiang and Hui Sun and Min Zhu and Shaoting Zhang and Junjun He and Yu Qiao},
  journal= {arXiv preprint arXiv:2311.11969},
  year   = {2023}
}