中文

基于分解的数据集蒸馏

计算机视觉与模式识别 2022-11-01 v1 机器学习

摘要

本文从一新视角研究数据集蒸馏(DD),并引入一种称为HaBa的数据集分解方法,它是一种可移植至任何现有DD基线的即插即用策略。不同于旨在生成蒸馏且具有代表性样本的传统DD方法,HaBa探索将数据集分解为两个组件:数据幻觉网络与基(Bases),后者输入前者以重建图像样本。基与幻觉网络之间的灵活组合因此使蒸馏数据获得指数级的信息量增益,大幅提升了蒸馏数据集的表示能力。为进一步提升压缩结果的数据效率,我们进一步在所得幻觉网络与基上引入一对对抗对比约束,增加了生成图像的多样性并向分解中注入更多判别信息。大量对比与实验表明,相较以往最优方法,我们的方法在下游分类任务上取得显著改进,同时将压缩参数总数减少多达65%。此外,我们方法蒸馏的数据集在跨架构泛化中也比基线方法高出约10%准确率。我们的代码见 https://github.com/Huage001/DatasetFactorization。

关键词

引用

@article{arxiv.2210.16774,
  title  = {Dataset Distillation via Factorization},
  author = {Songhua Liu and Kai Wang and Xingyi Yang and Jingwen Ye and Xinchao Wang},
  journal= {arXiv preprint arXiv:2210.16774},
  year   = {2022}
}

备注

NeurIPS 2022