具有凸代价函数的结构化 MDP 中的学习:库存管理的改进后悔界
机器学习
2019-05-14 v1 机器学习
摘要
我们考虑在需求删失、销售损失和正提前期下的随机库存控制问题。这是库存管理中的一个基本问题,大量文献已确立了一类称为“基库存策略”的简单策略对底层马尔可夫决策过程(MDP)的近最优性,以及这些策略下长期平均代价的凸性。我们考虑的是当底层需求分布未知时,为该问题设计学习算法这一研究相对较少的问题。目标是将算法的后悔值相对于最佳基库存策略进行界定。我们利用凸性性质以及新推导的基库存策略偏差界,建立与随机凸_bandit 优化的联系。我们的主要贡献是一个后悔界为 的库存控制问题学习算法。此处 是固定且已知的提前期, 是需求分布的一个未知参数,粗略描述为产生足够需求以耗尽一单位库存所需的时间步数。值得注意的是,尽管底层 MDP 的状态空间是连续且 维的,我们的后悔界对 呈线性依赖。我们的结果显著改进了此前该问题已知最好的后悔界,后者对 的依赖是指数的且需要对需求分布做诸多进一步假设。此处提出的技术对于涉及大型结构化 MDP 但具有凸代价函数的其他设定可能具有独立意义。
引用
@article{arxiv.1905.04337,
title = {Learning in structured MDPs with convex cost functions: Improved regret bounds for inventory management},
author = {Shipra Agrawal and Randy Jia},
journal= {arXiv preprint arXiv:1905.04337},
year = {2019}
}