通过引导学习:用于内镜图像分类的知识蒸馏
计算机视觉与模式识别
2023-08-21 v1
摘要
内镜在识别胃肠道(GI)内任何潜在异常中起着重要作用。有多种危及生命的 GI 道疾病,如癌前病变与其他肠道癌症。在常规流程中,由医学专家做出诊断,这可能易于出现人为错误,且检测准确性完全取决于专家的经验水平。深度学习,特别是为无需任何先验特征工程即可执行自动特征学习而设计的卷积神经网络(CNNs),最近被报道对 GI 内镜图像分析有巨大益处。先前研究开发的模型仅聚焦于提升性能,因此多数已引入的模型包含具有大量参数的复杂深度网络架构,需要更长训练时间。然而,缺乏对于开发可在低资源环境(通常为医疗诊所所面临)运行的轻量模型的关注。我们研究了三种基于 KD 的学习框架——响应基、特征基和关系基机制,并引入一种新颖的基于多头注意力的特征融合机制以支持关系基学习。与遵循多教师响应/特征基知识的简单聚合技术的现有关系基方法相比,我们采用多头注意力技术,以灵活定位并从每位教师迁移重要细节,从而更好地引导学生。我们在两个广泛使用的公共数据集 KVASIR-V2 和 Hyper-KVASIR 上进行了充分评估,实验结果证明了我们所提关系基框架在获得改进的轻量模型(仅 51.8k 可训练参数)方面的优势,该模型可在资源受限环境中运行。
引用
@article{arxiv.2308.08731,
title = {Learning Through Guidance: Knowledge Distillation for Endoscopic Image Classification},
author = {Harshala Gammulle and Yubo Chen and Sridha Sridharan and Travis Klein and Clinton Fookes},
journal= {arXiv preprint arXiv:2308.08731},
year = {2023}
}