中文

模型误设下基于特征的报童问题的保形方法

机器学习 2024-12-18 v1 机器学习

摘要

在许多数据驱动的决策问题中,性能保证通常严重依赖于模型假设的正确性,而这在实践中往往会失效。我们在基于特征的报童问题背景下探讨了这一问题,其中需求受人口统计和季节性等观测特征的影响。为了减轻模型误设的影响,我们提出了一种受 conformal prediction 启发的无模型且无分布的框架。我们的方法包含两个阶段:训练阶段,可以利用任何类型的预测方法;以及校准阶段,对模型偏差进行保形化处理。为了提高预测性能,我们探讨了数据质量与数量之间的平衡,并认识到其固有的权衡:更具选择性的训练数据可提高质量但会减少数量。重要的是,我们为保形化后的临界分位数提供了统计保证,该保证独立于底层模型的正确性。此外,我们量化了临界分位数的置信区间,其宽度随着数据质量和数量的提高而减小。我们使用模拟数据和来自华盛顿特区 Capital Bikeshare 项目的真实数据集验证了我们的框架。在这些实验中,我们提出的方法始终优于基准算法,在模拟数据上将报童损失降低了高达 40%,在真实数据集上降低了 25%。

关键词

引用

@article{arxiv.2412.13159,
  title  = {A Conformal Approach to Feature-based Newsvendor under Model Misspecification},
  author = {Junyu Cao},
  journal= {arXiv preprint arXiv:2412.13159},
  year   = {2024}
}