中文

扩展肿瘤分割:来自真实与合成数据的最佳经验

计算机视觉与模式识别 2025-11-04 v2

摘要

用于肿瘤分割的人工智能受到缺乏大规模、体素级标注数据集的限制,这些数据集难以创建且需要医学专家。在我们专有的包含3000张标注胰腺肿瘤扫描的JHH数据集中,我们发现AI性能在1500次扫描后停止提升。使用合成数据,我们仅用500张真实扫描就达到了相同的性能。这一发现表明,合成数据可以陡化数据缩放定律,从而实现比仅使用真实数据更高效的模型训练。受这些经验的启发,我们创建了AbdomenAtlas 2.0——一个包含10135张CT扫描的数据集,其中共有15130个肿瘤实例在六个器官(胰腺、肝脏、肾脏、结肠、食管和子宫)中进行了逐体素手动标注,以及5893张对照扫描。该数据集由23名专家放射科医生标注,其规模比现有的公共肿瘤数据集大几个数量级。在我们继续扩展数据集的同时,当前版本的AbdomenAtlas 2.0已经基于JHH数据集的经验,为训练AI分割六个器官的肿瘤提供了坚实的基础。它在分布内测试中实现了+7%的Dice相似系数增益,在分布外测试中实现了+16%的增益,相较于公共数据集有显著提升。

关键词

引用

@article{arxiv.2510.14831,
  title  = {Scaling Tumor Segmentation: Best Lessons from Real and Synthetic Data},
  author = {Qi Chen and Xinze Zhou and Chen Liu and Hao Chen and Wenxuan Li and Zekun Jiang and Ziyan Huang and Yuxuan Zhao and Dexin Yu and Junjun He and Yefeng Zheng and Ling Shao and Alan Yuille and Zongwei Zhou},
  journal= {arXiv preprint arXiv:2510.14831},
  year   = {2025}
}

备注

ICCV 2025