中文

利用小型代理数据集加速超参数搜索

机器学习 2019-06-13 v1 计算机视觉与模式识别 机器学习

摘要

机器学习工作流中最大的瓶颈之一是等待模型训练。根据可用计算资源的不同,在 ImageNet 这类具有众多类别的大型数据集上训练神经网络可能耗时数天至数周。对于尝试新算法思路的研究者而言,这在实际中过于耗时且昂贵。我们旨在生成更小的“代理数据集”,其上实验运行成本更低,但结果与完整数据集上的实验结果高度相关。我们通过从样本或类别中随机采样、仅在最简单或最难样本上训练,以及在由“数据蒸馏”生成的合成样本上训练来生成这些代理数据集。我们将这些技术与更广为使用的基线——以更少轮数在完整数据集上训练——进行比较。对于每种代理策略,我们估计“代理质量”的三种度量:完整数据集上实验结果的方差有多少可由代理数据集上的实验结果解释。在 Imagenette 和 Imagewoof(Howard, 2019)上的实验表明,在最简单的 10% 样本上运行超参数搜索可解释目标任务实验结果的 81% 方差,而使用最简单的 50% 样本可解释 95% 的方差,显著多于以更少轮数在所有数据上训练这一更常用的基线。这些“简单”代理的质量高于以缩减轮数(但等价计算成本)在完整数据集上训练,且出乎意料地高于由最难样本构建的代理。在无训练模型可用时,研究者可通过将子集限制为更少类别来提升代理质量;基于一半类别构建的代理质量高于在全部类别中散布等量样本的代理。

关键词

引用

@article{arxiv.1906.04887,
  title  = {Using Small Proxy Datasets to Accelerate Hyperparameter Search},
  author = {Sam Shleifer and Eric Prokop},
  journal= {arXiv preprint arXiv:1906.04887},
  year   = {2019}
}