以数据增强替代显式正则化
摘要
与大多数机器学习模型相反,现代深度人工神经网络通常包含多个有助于正则化的组件。尽管一些(显式)正则化技术(如权重衰减和 dropout)需要对敏感超参数进行昂贵的微调,但它们与其他提供隐式正则化的元素之间的相互作用尚不清楚。阐明这些相互作用是高效利用计算资源的关键,并可能有助于解开深度学习中泛化之谜。在此,我们首先提供显式和隐式正则化的形式化定义,以帮助理解各种技术之间的本质差异。其次,我们将数据增强与权重衰减和 dropout 进行了对比。我们的结果表明,仅使用数据增强训练的视觉目标分类模型,达到了与同时使用权重衰减和 dropout 训练(常规做法)的模型相同或更高的性能。我们得出结论,当提供了足够的隐式正则化时,权重衰减和 dropout 对泛化的贡献不仅是多余的,而且如果未针对架构和数据集仔细调整超参数,此类技术可能会显著降低性能。相比之下,数据增强系统地带来了巨大的泛化收益,且不需要重新调整超参数。鉴于我们的结果,我们建议在不使用权重衰减和 dropout 的情况下优化神经网络,以节省计算资源,从而减少碳排放,并将更多精力集中在数据增强和其他归纳偏置上,以提高性能和鲁棒性。
引用
@article{arxiv.1806.03852,
title = {Data augmentation instead of explicit regularization},
author = {Alex Hernández-García and Peter König},
journal= {arXiv preprint arXiv:1806.03852},
year = {2020}
}
备注
Major changes: 1. updated figures; 2. statistical significance analysis of results through bootstrap; 3. information about carbon emissions produced with the experiments; 4. extended discussion about the need for weight decay and dropout; 5. literature review updated; 6. slight update of the definitions of explicit and implicit regularization, with several examples for illustration