中文

超越独立同分布:异质环境下的数据驱动决策

机器学习 2025-01-03 v5 最优化与控制 机器学习

摘要

当历史观测无法完美预示未来时——例如由于存在无法“校正”的未观测混杂因素——应如何利用历史数据?受此问题启发,我们研究了一个数据驱动决策框架,其中历史样本生成自未知且不同的分布,这些分布被假设位于一个以未知的未来(样本外)分布为中心、半径已知的异质性球内,而决策的性能将在该未来分布上进行评估。本研究旨在分析中心化数据驱动策略以及近乎最优策略在这些异质环境中的表现,并理解性能的关键驱动因素。我们首先建立了一个结果,该结果能够为一类广泛策略的渐近最坏情况遗憾提供上界。利用这一结果,对于任意积分概率度量,我们给出了样本平均近似(SAA)所实现性能的通用分析,该分析表现为异质性球半径的函数。此分析围绕近似参数展开,这是我们引入的一个复杂性概念,用以刻画异质性与问题结构之间的相互作用如何影响SAA的性能。进而,我们通过几个被广泛研究的问题——例如报童问题、定价问题——说明了该方法如何应用,并发现SAA的性能因问题类别与异质性的组合不同而差异显著。SAA在某些实例中的失败促使我们设计替代策略以实现速率最优性。我们针对上述示例问题推导了具有强保证的问题依赖策略,并为通用速率最优算法的设计与分析提供了迈向原则性方法的初步结果。

关键词

引用

@article{arxiv.2206.09642,
  title  = {Beyond IID: data-driven decision-making in heterogeneous environments},
  author = {Omar Besbes and Will Ma and Omar Mouchtaki},
  journal= {arXiv preprint arXiv:2206.09642},
  year   = {2025}
}