中文

面向在线三维装箱的可调鲁棒强化学习

机器学习 2023-10-09 v1 人工智能

摘要

为在线三维装箱问题(3D-BPP)设计有效策略一直是一项长期挑战,主要源于到来箱体序列的不可预测性以及严苛的物理约束。当前用于在线 3D-BPP 的深度强化学习(DRL)方法在优化基于箱体序列分布的平均性能方面已展现出前景,但在某些最坏情况场景会实际发生的真实环境中往往失效。标准鲁棒 DRL 算法倾向于过度优先优化最坏情况性能,而以正常问题实例分布下的性能为代价。为解决这些问题,我们首先引入一种基于排列的攻击方,以考察已提出的基于 DRL 与启发式方法求解在线 3D-BPP 的实际鲁棒性。随后,我们提出一种可调鲁棒强化学习(AR2L)框架,允许高效调节鲁棒性权重,以实现策略在平均与最坏情况环境下的期望性能平衡。具体而言,我们将目标函数表述为期望收益与最坏情况收益的加权和,并通过关联混合动力学下的收益推导出性能下界。为实现该下界,我们采用一种迭代流程,搜索相应的混合动力学并改进对应策略。我们将此流程集成入两种流行的鲁棒对抗算法,以开发出精确与近似的 AR2L 算法。实验表明,AR2L 具有通用性:其在提升策略鲁棒性的同时保持了标称情形下可接受的性能水平。

关键词

引用

@article{arxiv.2310.04323,
  title  = {Adjustable Robust Reinforcement Learning for Online 3D Bin Packing},
  author = {Yuxin Pan and Yize Chen and Fangzhen Lin},
  journal= {arXiv preprint arXiv:2310.04323},
  year   = {2023}
}

备注

Accepted to NeurIPS2023