中文

利用掩码上下文建模与知识蒸馏微调多实例学习特征提取器

计算机视觉与模式识别 2024-03-11 v1

摘要

全切片图像 (WSI) 分类的多实例学习 (MIL) 算法的第一步是将输入图像平铺成较小的图块,并计算由预训练特征提取器模型生成的特征向量。在 ImageNet 上有监督预训练的特征提取器模型已被证明能很好地迁移到该领域,然而,这种预训练任务并未考虑到相邻图块中的视觉信息高度相关。基于这一观察,我们提出通过\textit{掩码上下文建模与知识蒸馏}微调特征提取器模型,以提升下游 MIL 分类性能。在该任务中,特征提取器模型通过在更大的上下文窗口中预测掩码图块来进行微调。由于重建输入图像需要强大的图像生成模型,而我们的目标并非生成看起来逼真的图像图块,因此我们转而预测由更大的教师网络生成的特征向量。所提出的任务仅需一个 epoch 即可提高特征提取器模型在 MIL 场景中的下游性能,甚至能够超越教师模型的下游性能,同时其规模 considerably 更小且仅需其一小部分的计算量。

关键词

引用

@article{arxiv.2403.05325,
  title  = {Fine-tuning a Multiple Instance Learning Feature Extractor with Masked Context Modelling and Knowledge Distillation},
  author = {Juan I. Pisula and Katarzyna Bozek},
  journal= {arXiv preprint arXiv:2403.05325},
  year   = {2024}
}