中文

适配你的教师:改进无范例持续学习中的知识蒸馏

机器学习 2023-11-07 v3 人工智能 计算机视觉与模式识别

摘要

在本工作中,我们研究以知识蒸馏(KD)作为正则化策略的无范例类增量学习(CIL),旨在防止遗忘。基于 KD 的方法已成功用于 CIL,但在无法访问先前任务训练数据范例的情况下,它们往往难以对模型进行正则化。我们的分析表明,该问题源于教师网络在处理分布外数据时发生显著的表示偏移。这导致 KD 损失分量出现较大误差,进而造成 CIL 模型性能下降。受近期测试时自适应方法的启发,我们提出教师自适应(TA),一种在增量训练期间同时更新教师和主模型的方法。我们的方法可与基于 KD 的 CIL 方法无缝集成,并能在多个无范例 CIL 基准上持续提升其性能。我们方法的源代码可在 https://github.com/fszatkowski/cl-teacher-adaptation 获取。

关键词

引用

@article{arxiv.2308.09544,
  title  = {Adapt Your Teacher: Improving Knowledge Distillation for Exemplar-free Continual Learning},
  author = {Filip Szatkowski and Mateusz Pyla and Marcin Przewięźlikowski and Sebastian Cygert and Bartłomiej Twardowski and Tomasz Trzciński},
  journal= {arXiv preprint arXiv:2308.09544},
  year   = {2023}
}

备注

Accepted at WACV 2024