基于不确定性采样、标注冗余限制与数据初始化的脑肿瘤分割主动学习
计算机视觉与模式识别
2023-02-22 v1 人工智能
机器学习
摘要
深度学习模型在医学三维影像中展现出巨大潜力,但其发展受限于所需标注数据量大且昂贵。主动学习(AL)通过在最具信息量的数据样本子集上训练模型而不损害性能来解决这一问题。我们比较了不同的 AL 策略,并提出了一种最小化达到最优性能所需数据量的框架。使用 638 张多机构脑肿瘤 MRI 图像训练三维 U-net 模型并比较 AL 策略。我们研究了不确定性采样、标注冗余限制和初始数据集选择技术。比较了包括带 dropout 的贝叶斯估计、自助法和边界采样在内的不确定性估计技术与随机查询。还考虑了通过移除待标注子集中相似图像来避免标注冗余的策略。我们确定了达到与全数据集训练模型相似性能所需的最小数据量({\alpha} = 0.1)。还提出了一种基于放射组学方差的选择策略来识别初始训练数据集。带 dropout 的贝叶斯近似在训练和测试时仅使用不到 20% 的训练数据即显示出与全数据模型相似的结果(p=0.293),而随机查询需 56.5% 的训练数据才达到相似性能(p=0.814)。标注冗余限制技术在约 40%-50% 的训练数据下达到了最优性能。放射组学数据集初始化在初始数据集大小为 20 和 80 张图像时具有更高的 Dice 系数,但改进不显著。总之,我们研究了多种 AL 策略,其中 dropout 不确定性估计以最少标注数据达到了最优性能。
引用
@article{arxiv.2302.10185,
title = {Active Learning in Brain Tumor Segmentation with Uncertainty Sampling, Annotation Redundancy Restriction, and Data Initialization},
author = {Daniel D Kim and Rajat S Chandra and Jian Peng and Jing Wu and Xue Feng and Michael Atalay and Chetan Bettegowda and Craig Jones and Haris Sair and Wei-hua Liao and Chengzhang Zhu and Beiji Zou and Li Yang and Anahita Fathi Kazerooni and Ali Nabavizadeh and Harrison X Bai and Zhicheng Jiao},
journal= {arXiv preprint arXiv:2302.10185},
year = {2023}
}
备注
22 pages, 3 figures, 3 tables, 1 supplementary data document. Submitted to Medical Physics in Jan 2023