中文

OpComm:面向仓库容量预测的基于强化学习的自适应缓冲区控制框架

机器学习 2025-12-24 v1

摘要

准确预测包裹量对于最后一公里物流至关重要,错误会导致资源分配不高效、成本增加和交付延误。在本文中,我们提出了 OpComm,一个结合监督学习与强化学习缓冲区控制及基于生成式AI驱动的通信模块的预测与决策支持框架。LightGBM 回归模型生成站点的需求预测,作为近端策略优化(PPO)代理选择缓冲区水平的上下文。奖励函数对缓冲不足的惩罚比缓冲过剩更重,反映实际中未满足需求风险与资源效率之间的权衡。将站点结果通过蒙特卡洛更新机制反馈,以实现持续的策略适应。为增强可解释性,生成式AI层基于 SHAP 特征归因生成决策者水平的摘要和情景分析。在400多个站点上,OpComm 将加权平均绝对百分比误差(WAPE)降低了21.65%,同时降低了缓冲不足事件,提高了决策者的透明度。本工作表明,结合预测建模的情境化强化学习可解决操作性预测挑战,并将统计严谨性与实际决策能力相结合于高风险物流环境中。

关键词

引用

@article{arxiv.2512.19738,
  title  = {OpComm: A Reinforcement Learning Framework for Adaptive Buffer Control in Warehouse Volume Forecasting},
  author = {Wilson Fung and Lu Guo and Drake Hilliard and Alessandro Casadei and Raj Ratan and Sreyoshi Bhaduri and Adi Surve and Nikhil Agarwal and Rohit Malshe and Pavan Mullapudi and Hungjen Wang and Saurabh Doodhwala and Ankush Pole and Arkajit Rakshit},
  journal= {arXiv preprint arXiv:2512.19738},
  year   = {2025}
}