从上下文数据到报童决策:数据驱动算法的实际性能
机器学习
2025-10-13 v5 最优化与控制
统计方法学
摘要
本工作中,我们通过分析一个上下文报童问题来研究过去数据的相关性/质量与数量如何影响性能,其中决策者在不确定需求下权衡缺货成本与过剩成本。我们考虑这样一种设定:在“邻近”上下文下观测到的过去需求来自邻近的分布,并通过上下文相关的最坏情形期望后悔这一概念来分析数据驱动算法的性能。我们分析了广义的加权经验风险最小化(WERM)策略类,该类依据过去数据在上下文空间中的相似度为其赋权。此类包含经典策略如 ERM、k-近邻与基于核的策略。我们方法上的主要贡献是精确刻画任意 WERM 策略在任意给定上下文配置下的最坏情形后悔。据我们所知,这提供了对任意上下文决策问题中紧性能保证的首次理解,既往文献聚焦于通过集中不等式给出上界。我们转而采用优化方法,并分离出报童损失函数中的一种结构,可将关于最坏情形分布的无限维优化问题化简为简单的线搜索。这进而使我们揭示出被先前通用界所掩盖的基本洞见。我们将实际保证性能刻画为上下文的函数,并给出关于算法学习曲线的细致洞见。
引用
@article{arxiv.2302.08424,
title = {From Contextual Data to Newsvendor Decisions: On the Actual Performance of Data-Driven Algorithms},
author = {Omar Besbes and Will Ma and Omar Mouchtaki},
journal= {arXiv preprint arXiv:2302.08424},
year = {2025}
}