基于约束深度强化学习的在线三维装箱
机器学习
2022-01-14 v5 机器学习
摘要
我们解决了三维装箱问题(3D-BPP)的一个具有挑战性但实用的变体。在我们的问题中,智能体对将要装入箱中的物品信息有限,且物品到达后必须立即装箱,不能缓冲或重新调整。物品的放置还需满足避免碰撞和物理稳定性的约束。我们将该在线3D-BPP建模为约束马尔可夫决策过程。为求解该问题,我们提出了一种在演员-评论家(actor-critic)框架下有效且易于实现的约束深度强化学习(DRL)方法。具体而言,我们引入一个可行性预测器来预测放置动作的可行性掩码,并用它来调节训练期间演员输出的动作概率。此类对DRL的监督与变换有助于智能体高效学习可行策略。我们的方法也可推广,例如能够处理前瞻或具有不同朝向的物品。我们进行了大量评估,表明所学策略显著优于最先进(state-of-the-art)方法。一项用户研究表明,我们的方法达到了人类水平的表现。
引用
@article{arxiv.2006.14978,
title = {Online 3D Bin Packing with Constrained Deep Reinforcement Learning},
author = {Hang Zhao and Qijin She and Chenyang Zhu and Yin Yang and Kai Xu},
journal= {arXiv preprint arXiv:2006.14978},
year = {2022}
}
备注
AAAI 2021