中文

单一模型以循环条件查询学习打包数千物品

人工智能 2021-11-15 v1 机器学习 神经与进化计算

摘要

近期研究表明,神经组合优化(NCO)在许多组合优化问题(如路径规划)上优于传统算法,但对于涉及相互 conditioned 动作空间的更复杂优化任务(如打包)则效率较低。在本文中,我们提出一种循环条件查询学习(RCQL)方法来求解 2D 与 3D 打包问题。我们首先通过循环编码器嵌入状态,然后采用带有来自先前动作的条件查询的注意力机制。条件查询机制填补了学习步骤之间的信息鸿沟,将问题塑造为马尔可夫决策过程。得益于循环结构,单一 RCQL 模型能够处理不同规模的打包问题。实验结果表明,RCQL 能有效学习用于离线与在线条带打包问题(SPPs)的强启发式策略,在空间利用率上优于广泛基线。与最先进方法相比,RCQL 在离线 2D 40 箱案例中平均箱间隙比降低 1.83%,在 3D 案例中降低 7.84%。同时,对于含 1000 物品的 SPPs,我们的方法空间利用率也比最先进水平高 5.64%。

关键词

引用

@article{arxiv.2111.06726,
  title  = {One model Packs Thousands of Items with Recurrent Conditional Query Learning},
  author = {Dongda Li and Zhaoquan Gu and Yuexuan Wang and Changwei Ren and Francis C. M. Lau},
  journal= {arXiv preprint arXiv:2111.06726},
  year   = {2021}
}

备注

16 pages, 5 figures, 3 tables. Accepted to Knowledge-Based Systems, 2022