中文

面向长尾视网膜疾病识别的关系子集知识蒸馏

计算机视觉与模式识别 2021-04-23 v1

摘要

在现实世界中,医学数据集常呈现长尾数据分布(即少数类别占据大部分数据,而大多数类别样本极少),这导致极具挑战的不平衡学习场景。例如,估计有超过40种不同的视网膜疾病且发病率各异,但从全球患者队列来看有30多种病症极为罕见,这给基于深度学习的筛查模型带来了典型的长尾学习问题。在本研究中,我们提出根据先验知识(如区域和表型信息)将长尾数据划分为多个类别子集,从而迫使模型专注于学习子集特定的知识。更具体地,存在一些关系类别固定于特定视网膜区域,或多数与少数病症中均观察到共同的病理特征。利用这些子集训练出的教师模型,我们能够通过加权知识蒸馏损失将多个教师模型蒸馏为一个统一模型。所提框架被证明对长尾视网膜疾病识别任务有效。在两个不同数据集上的实验结果表明,我们的方法灵活且可轻松嵌入许多其他最先进技术并取得显著提升。

关键词

引用

@article{arxiv.2104.11057,
  title  = {Relational Subsets Knowledge Distillation for Long-tailed Retinal Diseases Recognition},
  author = {Lie Ju and Xin Wang and Lin Wang and Tongliang Liu and Xin Zhao and Tom Drummond and Dwarikanath Mahapatra and Zongyuan Ge},
  journal= {arXiv preprint arXiv:2104.11057},
  year   = {2021}
}