面向在线三维装箱的可调鲁棒强化学习
机器学习
2023-10-09 v1 人工智能
摘要
为在线三维装箱问题(3D-BPP)设计有效策略一直是一项长期挑战,主要源于到来箱体序列的不可预测性以及严苛的物理约束。当前用于在线 3D-BPP 的深度强化学习(DRL)方法在优化基于箱体序列分布的平均性能方面已展现出前景,但在某些最坏情况场景会实际发生的真实环境中往往失效。标准鲁棒 DRL 算法倾向于过度优先优化最坏情况性能,而以正常问题实例分布下的性能为代价。为解决这些问题,我们首先引入一种基于排列的攻击方,以考察已提出的基于 DRL 与启发式方法求解在线 3D-BPP 的实际鲁棒性。随后,我们提出一种可调鲁棒强化学习(AR2L)框架,允许高效调节鲁棒性权重,以实现策略在平均与最坏情况环境下的期望性能平衡。具体而言,我们将目标函数表述为期望收益与最坏情况收益的加权和,并通过关联混合动力学下的收益推导出性能下界。为实现该下界,我们采用一种迭代流程,搜索相应的混合动力学并改进对应策略。我们将此流程集成入两种流行的鲁棒对抗算法,以开发出精确与近似的 AR2L 算法。实验表明,AR2L 具有通用性:其在提升策略鲁棒性的同时保持了标称情形下可接受的性能水平。
引用
@article{arxiv.2310.04323,
title = {Adjustable Robust Reinforcement Learning for Online 3D Bin Packing},
author = {Yuxin Pan and Yize Chen and Fangzhen Lin},
journal= {arXiv preprint arXiv:2310.04323},
year = {2023}
}
备注
Accepted to NeurIPS2023