中文

基于强化学习的高效退货管理

机器学习 2025-01-27 v1

摘要

在零售仓库中,退回的产品通常被存放在中间存储区域,直到决定是否将其运输至门店。产品在存储期间越长,存储效率和成本就越高,因为需要维持足够的存储空间。为降低产品的平均存储时间,我们考虑一种替代方案:在产品到达仓库后即可进行重新分配决策,但同时只能存储有限数量的产品。我们将问题转化为在线多背包问题,提出一种新颖的强化学习方法,将产品(item)装入背包(store)以最大化总体价值(预期收入)。在仿真数据上的实证评估表明,与常规离线决策流程相比,我们的方法仅在性能上存在 3% 的差距,但将产品的平均存储时间显著降低了 96%。

关键词

引用

@article{arxiv.2501.14394,
  title  = {Reinforcement Learning for Efficient Returns Management},
  author = {Pascal Linden and Nathalie Paul and Tim Wirtz and Stefan Wrobel},
  journal= {arXiv preprint arXiv:2501.14394},
  year   = {2025}
}