中文

分布鲁棒分组正则化估计量

统计理论 2017-05-12 v1 统计理论

摘要

在分组变量背景下的正则化估计量已成功应用于模型和特征选择,以保持可解释性。我们提出一个分布鲁棒优化 (DRO) 问题,它恢复了流行的估计量,例如分组平方根 Lasso (GSRL)。我们的 DRO 公式使我们能够将 GSRL 解释为一个博弈,其中我们学习一个回归参数,而一个对抗者选择数据的扰动。我们希望选取参数以最小化由对抗者选择的任何合理模型下的期望损失——而对抗者则希望增加期望损失。正则化参数恰好由对抗者允许的训练数据扰动量决定。在本文中,我们引入了一个用于正则化最优选择的数据驱动(统计)准则,并随着训练集大小的增加以闭式渐近地评估它。我们将易于评估的正则化公式与交叉验证进行比较,显示出良好(有时更优)的性能。

关键词

引用

@article{arxiv.1705.04241,
  title  = {Distributionally Robust Groupwise Regularization Estimator},
  author = {Jose Blanchet and Yang Kang},
  journal= {arXiv preprint arXiv:1705.04241},
  year   = {2017}
}

备注

21 Pages, 1 Figure