中文

混合记忆回放:用于类别增量学习的真实数据与蒸馏数据混合

机器学习 2024-10-22 v1

摘要

增量学习(IL)旨在从当前任务中获取新知识,同时保留从先前任务中学习的知识。基于回放的 IL 方法通过在缓冲区中存储先前任务的示例集,并在学习新任务时重放它们来实现。然而,缓冲区通常有限,无法存储足够的真实示例来保留先前任务的知识。相比之下,数据蒸馏(DD)可以通过将大型真实数据集浓缩为一小组更信息密集的合成示例来减少示例缓冲区的大小。然而,DD 在合成示例数量增长时,对 IL 的性能提升迅速消失。为克服真实数据和合成数据缓冲区的弱点,我们采用包含两种类型数据的混合记忆进行优化。具体而言,我们提出了一种创新的 DD 修改方案,从历史中滑动窗口的检查点(而非多个训练轨迹的检查点)蒸馏合成数据。基于合成数据,我们 then 优化了真实示例的选择,以在 DD 目标上提供补充性改进。优化后的混合记忆结合了合成和真实示例的优势,有效缓解了在示例缓冲区有限的情况下进行类别增量学习(CIL)时的灾难性遗忘。值得注意的是,我们的方法可以无缝集成到大多数现有基于回放的 CIL 模型中。广泛的实验表明,我们的方法在多个基准测试上显著优于现有的基于回放的基线方法。

关键词

引用

@article{arxiv.2410.15372,
  title  = {Hybrid Memory Replay: Blending Real and Distilled Data for Class Incremental Learning},
  author = {Jiangtao Kong and Jiacheng Shi and Ashley Gao and Shaohan Hu and Tianyi Zhou and Huajie Shao},
  journal= {arXiv preprint arXiv:2410.15372},
  year   = {2024}
}