中文

采样以蒸馏:来自开放世界数据的知识迁移

计算机视觉与模式识别 2024-07-23 v2

摘要

无数据知识蒸馏(DFKD)是一项新任务,旨在仅利用预训练教师网络而不使用原始训练数据来训练高性能学生模型。现有 DFKD 方法大多严重依赖额外生成模块来合成替代数据,导致高计算成本,并忽视了海量易获取、低成本的未标注开放世界数据。同时,现有方法忽略替代数据与原始数据间的域偏移问题,致使教师知识并非总是可信,而来自数据的结构化知识成为关键补充。为此,我们提出一种新颖的开放世界数据采样蒸馏(ODSD)方法用于 DFKD 任务,无需冗余生成过程。首先,我们通过自适应采样模块采样接近原始数据分布的开放世界数据,并引入低噪声表示以缓解域偏移问题。随后,我们构建多数据样本的结构化关系,通过学生模型自身及教师的结构化表示来利用数据知识。在 CIFAR-10、CIFAR-100、NYUv2 和 ImageNet 上的大量实验表明,我们的 ODSD 方法以更低 FLOPs 与参数量达到 SOTA 性能。尤其在 ImageNet 数据集上提升 1.50\%–9.59\% 准确率,且避免为每个类训练独立生成器。

关键词

引用

@article{arxiv.2307.16601,
  title  = {Sampling to Distill: Knowledge Transfer from Open-World Data},
  author = {Yuzheng Wang and Zhaoyu Chen and Jie Zhang and Dingkang Yang and Zuhao Ge and Yang Liu and Siao Liu and Yunquan Sun and Wenqiang Zhang and Lizhe Qi},
  journal= {arXiv preprint arXiv:2307.16601},
  year   = {2024}
}

备注

Accepted by ACMMM2024