中文

数据究竟该多大?数据驱动报童问题:一次学习一个样本

最优化与控制 2022-07-27 v3

摘要

我们研究经典报童问题,其中决策者必须权衡缺货成本与过剩成本。与典型设定相反,我们假设决策者不知道驱动不确定性的底层分布,仅能获取历史数据。进而关键问题是如何将现有数据映射为决策,以及作为数据量函数可期望何种性能。我们分析可获取来自分布的历史样本(例如过去需求)的经典设定,不仅关注渐近性能,也关注我们所称的学习瞬态 regime,即任意数据量下的性能。我们通过最坏情况相对期望后悔(相较于知晓分布的神谕)评估任何算法的性能。我们首次给出了经典样本平均近似(SAA)算法在所有数据量下此类问题的有限样本精确分析。这揭示了对数据价值的新颖根本性洞察:数十个样本即足以非常高效地表现,但更多数据也可能导致 SAA 的样本外性能变差。随后我们关注从数据到决策的映射的一般类别,不对策略集作限制,推导出最优算法(在极小极大意义下)并刻画其关联性能。这在有限数据量下带来显著改进,并得以精确量化历史信息的价值。

关键词

引用

@article{arxiv.2107.02742,
  title  = {How Big Should Your Data Really Be? Data-Driven Newsvendor: Learning One Sample at a Time},
  author = {Omar Besbes and Omar Mouchtaki},
  journal= {arXiv preprint arXiv:2107.02742},
  year   = {2022}
}