基于随机特征近似的高效数据集蒸馏
机器学习
2022-10-24 v1 人工智能
神经与进化计算
机器学习
摘要
数据集蒸馏将大型数据集压缩为较小的合成核心集(coreset),在保持性能的同时旨在降低处理整个数据集的存储与计算负担。当前性能最佳的算法 \textit{Kernel Inducing Points} (KIP) 利用了无限宽神经网络与核岭回归之间的对应关系,但由于精确计算神经正切核矩阵而极其缓慢,其复杂度为 ,其中 为核心集大小。为改进此问题,我们提出了一种新算法,使用神经网络高斯过程(NNGP)核的随机特征近似(RFA),将核矩阵计算降至 。我们的算法相较KIP至少提供100倍加速,并可在单块GPU上运行。我们的新方法称为RFA蒸馏(RFAD),在一系列大规模数据集上的核回归与有限宽网络训练中,准确率可与KIP及其他数据集凝聚算法竞争。我们展示了该方法在模型可解释性与隐私保护相关任务中的有效性。
引用
@article{arxiv.2210.12067,
title = {Efficient Dataset Distillation Using Random Feature Approximation},
author = {Noel Loo and Ramin Hasani and Alexander Amini and Daniela Rus},
journal= {arXiv preprint arXiv:2210.12067},
year = {2022}
}
备注
Accepted to the Conference on the Advances in Neural Information Processing Systems (NeurIPS) 2022