数据收集与数据培育:基于深度学习的乳腺癌患者自动分割中变异度与样本量重要性的研究
医学物理
2024-04-05 v1
摘要
本研究的目的是调查在三种不同场景下训练模型时输出的差异:一个大型临床勾画数据集(训练/测试分别为 700/78 名患者,来自丹麦乳腺癌组(DBCG)RT Nation 研究),一个临床但经过筛选的数据集(训练/测试分别为 328/36 名患者,来自 DBCG RT Nation 研究),以及一个较小但由勾画专家创建的专用数据集(训练/测试分别为 123/14 名患者,共识勾画由勾画专家创建)。模型性能基于性能指标 Dice 相似系数(DSC)、Hausdorff 第 95 百分位数(HD95)和平均表面距离(MSD)进行评估。模型首先在各自队列的测试集中进行测试,随后在专用数据测试集中进行比较。模型输出之间的差异最终通过测量各模型输出的平均宽度和头尾向长度来估计。在各自测试集中对临床模型和专用模型的输出进行测试时,两个临床模型的性能比专用模型差,但并非所有指标均显示统计学显著性。在专用数据中测试模型时,专用模型表现出略好的性能,且分割离群点更少。作为利用两种数据集优势的方法,一种可行的选择是使用大型临床数据集作为基线模型,然后使用具有专用勾画的较小队列进行微调。
引用
@article{arxiv.2404.03369,
title = {Data harvesting vs data farming: A study of the importance of variation vs sample size in deep learning-based auto-segmentation for breast cancer patients},
author = {ES Buhl and E Maae and LW Matthiessen and MH Nielsen and M Maraldo and M Møller and S Elleberg and SAJ Al-Rawi and BV Offersen and SS Korreman},
journal= {arXiv preprint arXiv:2404.03369},
year = {2024}
}
备注
4 pages, 2 figures, 2 tables, submitted to the ICCR 2024