中文

用于减少浪费的仿真环境与强化学习方法

机器学习 2023-05-29 v2 人工智能

摘要

在零售业(如杂货店、服装店、在线零售商)中,库存管理者必须平衡短期风险(无货可售)与长期风险(过量订货导致产品浪费)。由于缺乏对客户未来购买的信息,这一平衡任务尤为困难。本文从分布视角研究随时间对杂货店易腐品库存补货的问题。目标是在客户实际消费不确定的情况下最大化销售并最小化浪费。鉴于食品需求增长及食物浪费对环境、经济与购买力的冲击,该问题当今极具现实意义。我们将库存补货构建为一个新的强化学习任务,其表现出依赖于智能体动作的随机行为,使环境部分可观测。我们作出两项主要贡献。首先,我们基于真实杂货店数据与专家知识引入了新强化学习环境RetaiL。该环境高度随机,对强化学习研究者构成独特挑战。我们表明经典供应链算法不能很好处理环境未来行为的不确定性,而分布式方法是应对该不确定性的良好途径。其次,我们引入GTDQN,一种在奖励空间上学习广义Tukey Lambda分布的分布式强化学习算法。GTDQN为我们的环境提供了强基线。在整体奖励与减少所产生浪费两方面,它均优于其他分布式强化学习方法于此部分可观测设定下。

关键词

引用

@article{arxiv.2205.15455,
  title  = {A Simulation Environment and Reinforcement Learning Method for Waste Reduction},
  author = {Sami Jullien and Mozhdeh Ariannezhad and Paul Groth and Maarten de Rijke},
  journal= {arXiv preprint arXiv:2205.15455},
  year   = {2023}
}

备注

20 pages, 4 figures, 4 tables, 3 listings, 1 algorithm