中文

随机优化中的数据池化

最优化与控制 2020-09-11 v3 机器学习 统计理论 统计理论

摘要

管理大规模系统往往涉及同时求解数千个不相关的随机优化问题,每个问题的数据都十分有限。直觉表明,人们可以将这些不相关的问题解耦并分别求解而不失一般性。我们提出了一种称为 Shrunken-SAA 的新型数据池化算法,推翻了这一直觉。具体而言,我们证明,即使问题之间不存在先验的结构联系且数据独立抽取,跨问题组合数据仍可以优于解耦。我们的方法不需要强的分布假设,并适用于约束的、可能非凸、非光滑的优化问题,例如车辆路径、经济批量规模或设施选址。我们将所得结果与统计学中类似的现象(Stein 现象)进行比较与对照,突出优化设定下特有而在估计中不存在的特征。我们进一步证明,当问题数量趋于很大时,即使每个问题的平均数据量固定且有界,Shrunken-SAA 也能学习到池化是否优于解耦以及最优的池化量。重要的是,我们基于稳定性给出了一个简单直觉,阐明数据池化何时以及为何带来收益,从而解释这一或许令人惊讶的现象。该直觉进一步表明,当存在许多问题且每个问题只有少量相关数据时,数据池化带来的收益最大。最后,我们利用一家连锁零售药店在库存管理中的真实数据展示了数据池化的实际收益。

关键词

引用

@article{arxiv.1906.00255,
  title  = {Data-Pooling in Stochastic Optimization},
  author = {Vishal Gupta and Nathan Kallus},
  journal= {arXiv preprint arXiv:1906.00255},
  year   = {2020}
}