中文

基于随机特征近似的高效数据集蒸馏

机器学习 2022-10-24 v1 人工智能 神经与进化计算 机器学习

摘要

数据集蒸馏将大型数据集压缩为较小的合成核心集(coreset),在保持性能的同时旨在降低处理整个数据集的存储与计算负担。当前性能最佳的算法 \textit{Kernel Inducing Points} (KIP) 利用了无限宽神经网络与核岭回归之间的对应关系,但由于精确计算神经正切核矩阵而极其缓慢,其复杂度为 O(S2)O(|S|^2),其中 S|S| 为核心集大小。为改进此问题,我们提出了一种新算法,使用神经网络高斯过程(NNGP)核的随机特征近似(RFA),将核矩阵计算降至 O(S)O(|S|)。我们的算法相较KIP至少提供100倍加速,并可在单块GPU上运行。我们的新方法称为RFA蒸馏(RFAD),在一系列大规模数据集上的核回归与有限宽网络训练中,准确率可与KIP及其他数据集凝聚算法竞争。我们展示了该方法在模型可解释性与隐私保护相关任务中的有效性。

关键词

引用

@article{arxiv.2210.12067,
  title  = {Efficient Dataset Distillation Using Random Feature Approximation},
  author = {Noel Loo and Ramin Hasani and Alexander Amini and Daniela Rus},
  journal= {arXiv preprint arXiv:2210.12067},
  year   = {2022}
}

备注

Accepted to the Conference on the Advances in Neural Information Processing Systems (NeurIPS) 2022