中文

深度学习在甲状腺肿瘤分类中的自动筛选数据集有效性

计算机视觉与模式识别 2026-02-03 v1

摘要

甲状腺肿瘤癌症诊断常依赖于超声图像。此前研究表明,专为分类良性和恶性甲状腺肿瘤而设计的深度学习算法可与放射科医生的诊断水平相当。然而,由于筛选此类数据集所需的大量工作,训练深度学习模型的数据获取往往受限。此前研究提出了一种自动筛选甲状腺肿瘤数据集的方法,测试显示其获得率为63%,准确率为83%。但这些生成数据对训练深度学习模型是否实用尚不清楚。本研究通过实验探讨了使用自动筛选数据集是否能提高深度学习算法的性能。我们在手动标注数据集和自动筛选数据集上训练了深度学习模型。还训练了一个使用自动筛选数据集中准确率较高的子集,以探讨最佳数据用法。结果表明, 在手动挑选数据集上训练的深度学习模型AUC为0.643(95%置信区间[CI]:0.62,0.66),显著低于在完整自动筛选数据集上训练的模型AUC为0.694(95%置信区间[CI]:0.67,0.73,P<.001)。准确子集训练的模型AUC为0.689(95%置信区间[CI]:0.66,0.72,P>.43),与完整自动筛选数据集的AUC无显著差异。本研究表明,使用自动筛选数据集可显著提高深度学习算法的性能,建议使用完整数据集而非仅使用准确子集。

关键词

引用

@article{arxiv.2602.01020,
  title  = {Effectiveness of Automatically Curated Dataset in Thyroid Nodules Classification Algorithms Using Deep Learning},
  author = {Jichen Yang and Jikai Zhang and Benjamin Wildman-Tobriner and Maciej A. Mazurowski},
  journal= {arXiv preprint arXiv:2602.01020},
  year   = {2026}
}

备注

9 pages, 3 figures