神经网络超参数优化中单纯丢弃一个 epoch 的非合理有效性
机器学习
2024-04-08 v1
摘要
要实现深度学习的高性能,超参数优化(HPO)至关重要。该过程通常耗时,因为神经网络评估成本高昂。Early discarding 技术通过观察经验学习曲线来限制对不具竞争力的候选者所获资源,并在显现出候选者缺乏竞争力时尽快取消神经网络训练。尽管已有二十年的研究,关于丢弃的激进程度与预测性能之间的权衡仍知之甚少。我们的论文研究了这种权衡,针对诸如 successive halving 和学习曲线外推等常用丢弃技术进行分析。我们的惊人发现是,这些常用技术与简单丢弃在固定 epoch 数训练后所获的策略几乎没有什么额外价值或完全没有价值。所选的 epoch 数主要取决于可用计算预算。我们称之为 i-Epoch(i 指用于训练神经网络的固定 epoch 数),并建议通过比较其在消耗训练 epoch 数和预测性能方面的帕累托前沿,来评估 early discarding 技术的质量。
引用
@article{arxiv.2404.04111,
title = {The Unreasonable Effectiveness Of Early Discarding After One Epoch In Neural Network Hyperparameter Optimization},
author = {Romain Egele and Felix Mohr and Tom Viering and Prasanna Balaprakash},
journal= {arXiv preprint arXiv:2404.04111},
year = {2024}
}