中文

学习人员配置:基于离线强化学习和微调大语言模型的仓库人员优化

机器学习 2026-03-27 v1

摘要

我们探讨了用于优化半自动化仓库分拣系统中实时人员配置决策的机器学习方法。 operational 决策可在不同抽象层次上进行支持,具有不同的权衡。我们评估了两种方法,每种方法都在匹配的仿真环境中进行。首先,我们使用离线强化学习在详细的历史状态表示上训练定制的 Transformer 基于策略的模型,实现对历史基准的 2.4% 吞吐量提升。在高容量仓库运营中,这种规模的改进可转化为显著的节省。其次,我们探索基于抽象、人类可读状态描述的大语言模型 (LLM)。这些模型是仓库经理使用高层次运营概述做出决策的自然选择。我们系统比较了不同的提示技术、自动提示优化和微调策略。尽管仅靠提示技术证明不足,但结合 Direct Preference Optimization 在仿真器生成的偏好上进行监督式微调可实现与历史基准相当或略高于手工制作仿真器的性能。我们的发现表明,这两种方法都为 AI 辅助 operational 决策提供了可行的路径。离线强化学习在任务特定架构方面表现出色。大语言模型支持人类可读输入,并可与可 incorporating 经理偏好的迭代反馈循环相结合。

关键词

引用

@article{arxiv.2603.24883,
  title  = {Learning to Staff: Offline Reinforcement Learning and Fine-Tuned LLMs for Warehouse Staffing Optimization},
  author = {Kalle Kujanpää and Yuying Zhu and Kristina Klinkner and Shervin Malmasi},
  journal= {arXiv preprint arXiv:2603.24883},
  year   = {2026}
}

备注

ICLR 2026 Workshop on AI for Mechanism Design and Strategic Decision Making