中文

Lesion Harvester:大规模迭代挖掘未标注病灶与难负例

计算机视觉与模式识别 2020-11-24 v3

摘要

训练机器学习算法所需的大规模医学图像数据的获取,常因专家标注成本过高而难以实现。近期从医院档案中提取的数据集(如 DeepLesion)已开始着手解决此问题。然而,这些数据集往往标注不完整或含噪声,例如 DeepLesion 有超过 50% 的病灶未被标注。因此,有效挖掘缺失标注的方法对医学图像分析的持续进展至关重要。这正是我们工作的目标:我们开发了一套强大的系统,以高精度从 DeepLesion 数据集中挖掘缺失病灶。在承认需要一定程度专家劳动以实现高保真的前提下,我们利用一小部分完全标注的医学图像体数据,并借此从剩余数据中智能挖掘标注。为此,我们将一个高灵敏度病灶提议生成器与一个高选择性病灶提议分类器串联。尽管我们的框架具有通用性,我们通过提出三维上下文病灶提议生成器并使用多视角多尺度病灶提议分类器来优化性能。它们产生挖掘出的与难负例提议,我们随后通过一种新颖的难负例抑制损失将其复用于微调提议生成器,并循环此过程直至不再发现额外病灶。大量实验分析表明,我们的方法可额外挖掘 9,805 个病灶,同时将精度保持在 90% 以上。为展示我们方法的益处,我们表明在我们挖掘的病灶上训练的病灶检测器可显著优于仅在原始标注上训练的同类变体,平均精度提升 7% 至 10%。我们在 https://github.com/JimmyCai91/DeepLesionAnnotation 开源了我们的标注。

关键词

引用

@article{arxiv.2001.07776,
  title  = {Lesion Harvester: Iteratively Mining Unlabeled Lesions and Hard-Negative Examples at Scale},
  author = {Jinzheng Cai and Adam P. Harrison and Youjing Zheng and Ke Yan and Yuankai Huo and Jing Xiao and Lin Yang and Le Lu},
  journal= {arXiv preprint arXiv:2001.07776},
  year   = {2020}
}

备注

13 pages, 13 figures, to appear in IEEE Transactions on Medical Imaging