中文

数据采样影响依赖数据上在线SGD的复杂度

机器学习 2022-04-04 v1 最优化与控制

摘要

传统的机器学习应用通常假设数据样本独立同分布(i.i.d.)。然而,实际场景常涉及产生高度依赖数据样本的数据生成过程,已知这会严重偏置随机优化过程并减慢学习的收敛速度。在本文中,我们对不同的随机数据采样方案如何影响高度依赖数据上在线随机梯度下降(SGD)的样本复杂度进行了基础性研究。具体而言,基于数据的 ϕ\phi-混合依赖模型,我们表明具有适当周期性数据子采样的在线SGD在整个数据依赖程度范围内均实现了优于标准在线SGD的样本复杂度。有趣的是,即使对数据样本的子集进行子采样也能加速高度依赖数据上在线SGD的收敛。此外,我们表明具有小批量采样的在线SGD可进一步大幅改善高度依赖数据上周期性数据子采样的在线SGD的样本复杂度。数值实验验证了我们的理论结果。

关键词

引用

@article{arxiv.2204.00006,
  title  = {Data Sampling Affects the Complexity of Online SGD over Dependent Data},
  author = {Shaocong Ma and Ziyi Chen and Yi Zhou and Kaiyi Ji and Yingbin Liang},
  journal= {arXiv preprint arXiv:2204.00006},
  year   = {2022}
}