基于固有动机反馈图的强化学习:用于损失销售库存控制
机器学习
2025-02-18 v2 人工智能
摘要
强化学习(RL)在库存控制(IC)领域已证明表现良好且通用。然而,由于在线经验的两个局限性,进一步提高 RL 在 IC 领域的性能受到阻碍。第一,线上经验在实际应用中获取成本高昂。鉴于 RL 算法的低样本效率,训练 RL 策略收敛需要大量时间。第二,线上经验可能无法反映真实需求,因为库存控制中常见的损失销售现象会使学习过程更具挑战性。为此,我们提出一种结合强化学习与反馈图(RLFG)和内在动机探索(IME)的决策框架,以提升样本效率。在具体而言,我们首先利用损失销售 IC 问题的固有属性,专为损失销售 IC 问题设计反馈图(FG),以生成丰富的副经验辅助 RL 更新。随后,我们对所设计的 FG 如何降低 RL 方法的样本复杂度进行严格的理论分析。基于这些理论见解,我们设计了一种内在奖励,以引导 RL 代理探索到具有更多副经验的状态-动作空间,进一步发挥 FG 的优势。实验结果表明,我们的方法显著提高了将 RL 应用于 IC 的样本效率。我们的代码已公开于 https://anonymous.4open.science/r/RLIMFG4IC-811D/。
引用
@article{arxiv.2406.18351,
title = {Reinforcement Learning with Intrinsically Motivated Feedback Graph for Lost-sales Inventory Control},
author = {Zifan Liu and Xinran Li and Shibo Chen and Gen Li and Jiashuo Jiang and Jun Zhang},
journal= {arXiv preprint arXiv:2406.18351},
year = {2025}
}