中文

One4Many-StablePacker:面向3D堆箱问题的高效深度强化学习框架

机器学习 2025-10-14 v1

摘要

三维堆箱问题(3D-BPP)在物流和仓储领域得到广泛应用。现有学习方法往往忽视实际中的稳定性相关约束,并且在不同堆箱尺寸上存在泛化性不足的问题。为此,本文提出一种新型深度强化学习框架——One4Many-StablePacker(O4M-SP)。O4M-SP的主要优势在于能够在单次训练过程中处理各种堆箱尺寸,并且融合了实际场景中常见的支撑约束和重量约束。我们的训练方法引入了两种创新机制。首先,采用加权奖励函数,将装载率与一种新的高度差度量集成,用于改善堆箱布局,从而通过更平坦的堆箱配置实现更好的堆箱利用率。其次,结合裁剪策略梯度优化与量身定制的策略漂移方法,以缓解策略熵的崩溃,鼓励在堆箱关键决策节点进行探索,以避免次优解。大量实验表明,O4M-SP能够成功地跨越不同堆箱尺寸进行泛化,并且显著优于基线方法。此外,O4M-SP在处理具有稳定性约束的堆箱场景时表现出强大的实际应用价值。

关键词

引用

@article{arxiv.2510.10057,
  title  = {One4Many-StablePacker: An Efficient Deep Reinforcement Learning Framework for the 3D Bin Packing Problem},
  author = {Lei Gao and Shihong Huang and Shengjie Wang and Hong Ma and Feng Zhang and Hengda Bao and Qichang Chen and Weihua Zhou},
  journal= {arXiv preprint arXiv:2510.10057},
  year   = {2025}
}