中文

一种面向学习增强问题且具有未来施加条件的极小极大-马尔可夫决策过程框架

机器学习 2025-05-05 v1 最优化与控制

摘要

我们研究一类具有增强预测的顺序决策问题,这些预测可能由机器学习算法提供。在此设定下,决策者接收针对未知参数的预测区间,这些区间随时间逐步细化,并寻求在参数和预测的所有可能实现下均能与事后最优决策相竞争的决策。我们提出了一个极小极大马尔可夫决策过程(minimax-MDP)框架,其中系统状态由一个对抗性演化的环境状态和一个由决策者控制的内部状态组成。我们引入了一组未来施加条件,这些条件刻画了极小极大-MDP 的可行性,并使得能够设计出高效、通常具有闭式解的鲁棒竞争策略。我们通过三个应用来说明该框架:具有逐步细化的需求预测的多期库存订购、具有不确定效用函数的资源分配,以及应用于具有时变订购成本的库存问题的极小极大-MDP 的多阶段扩展。我们的结果为在预测不确定性下的鲁棒在线决策提供了一种易于处理且通用的方法。

关键词

引用

@article{arxiv.2505.00973,
  title  = {A Minimax-MDP Framework with Future-imposed Conditions for Learning-augmented Problems},
  author = {Xin Chen and Yuze Chen and Yuan Zhou},
  journal= {arXiv preprint arXiv:2505.00973},
  year   = {2025}
}

备注

64 pages, 1 figure