SelectiveKD: 通过知识蒸馏与伪标签实现 DBT 癌症检测的半监督框架
计算机视觉与模式识别
2024-09-26 v1
摘要
在开发用于数字乳腺断层合成(DBT)的计算机辅助检测(CAD)系统时,该模态体积特性带来的复杂性对获取大规模准确标注构成了重大技术挑战。若无法获取大规模标注,所得模型可能无法泛化至不同领域。鉴于获取 DBT 标注的成本高昂,如何有效增加用于训练 DBT CAD 系统的数据量仍是一个开放挑战。在本文中,我们提出了 SelectiveKD,一个用于构建 DBT 癌症检测模型的半监督学习框架,该框架仅需有限数量的标注切片即可达到高性能。我们通过利用 DBT 序列中可用的未标注切片来实现这一点,采用知识蒸馏框架,其中教师模型为 DBT 体积中的所有切片向学生模型提供监督信号。我们的框架通过实施使用伪标签的选择性数据集扩展策略,缓解了次优教师模型在监督信号中产生的潜在噪声。我们使用包含来自多个设备制造商和地点的超过 10,000 次 DBT 检查的大规模真实世界数据集评估了我们的方法。所得的 SelectiveKD 流程有效利用了 DBT 序列中的未标注切片,显著提升了癌症分类性能(AUC)和泛化性能。
引用
@article{arxiv.2409.16581,
title = {SelectiveKD: A semi-supervised framework for cancer detection in DBT through Knowledge Distillation and Pseudo-labeling},
author = {Laurent Dillard and Hyeonsoo Lee and Weonsuk Lee and Tae Soo Kim and Ali Diba and Thijs Kooi},
journal= {arXiv preprint arXiv:2409.16581},
year = {2024}
}
备注
10 pages, 2 figures, 1 table