随机洗牌仅在病态问题上经过多轮迭代后才优于 SGD
机器学习
2021-12-07 v2
摘要
近来,研究无放回 SGD 的收敛速率、并证明其在最坏情况下快于有放回 SGD 引起了诸多关注。然而,已知下界忽略了问题的几何性质(包括其条件数),而上界则显式依赖于它。或许令人惊讶的是,我们证明当考虑条件数时,无放回 SGD 在最坏情况界上并不会显著优于有放回 SGD,除非轮数(遍历数据的次数)大于条件数。由于机器学习及其他领域的许多问题既病态又涉及大型数据集,这表明对于现实的迭代预算,无放回未必优于有放回采样。我们通过提供对于具有可交换二次项的二次问题的新下界和上界(紧至对数因子)来展示这一点,精确量化了对问题参数的依赖。
引用
@article{arxiv.2106.06880,
title = {Random Shuffling Beats SGD Only After Many Epochs on Ill-Conditioned Problems},
author = {Itay Safran and Ohad Shamir},
journal= {arXiv preprint arXiv:2106.06880},
year = {2021}
}