中文

具有凸代价函数的结构化 MDP 中的学习:库存管理的改进后悔界

机器学习 2019-05-14 v1 机器学习

摘要

我们考虑在需求删失、销售损失和正提前期下的随机库存控制问题。这是库存管理中的一个基本问题,大量文献已确立了一类称为“基库存策略”的简单策略对底层马尔可夫决策过程(MDP)的近最优性,以及这些策略下长期平均代价的凸性。我们考虑的是当底层需求分布未知时,为该问题设计学习算法这一研究相对较少的问题。目标是将算法的后悔值相对于最佳基库存策略进行界定。我们利用凸性性质以及新推导的基库存策略偏差界,建立与随机凸_bandit 优化的联系。我们的主要贡献是一个后悔界为 O~(LT+D)\tilde{O}(L\sqrt{T}+D) 的库存控制问题学习算法。此处 LL 是固定且已知的提前期,DD 是需求分布的一个未知参数,粗略描述为产生足够需求以耗尽一单位库存所需的时间步数。值得注意的是,尽管底层 MDP 的状态空间是连续且 LL 维的,我们的后悔界对 LL 呈线性依赖。我们的结果显著改进了此前该问题已知最好的后悔界,后者对 LL 的依赖是指数的且需要对需求分布做诸多进一步假设。此处提出的技术对于涉及大型结构化 MDP 但具有凸代价函数的其他设定可能具有独立意义。

关键词

引用

@article{arxiv.1905.04337,
  title  = {Learning in structured MDPs with convex cost functions: Improved regret bounds for inventory management},
  author = {Shipra Agrawal and Randy Jia},
  journal= {arXiv preprint arXiv:1905.04337},
  year   = {2019}
}