中文

一种基于状态聚合方法求解背包问题的深度强化学习途径

神经与进化计算 2020-04-28 v1 人工智能 机器学习

摘要

本文提出一种用于求解背包问题的深度强化学习(DRL)方法。所提方法包含一个基于表格强化学习的状态聚合步骤,用于提取特征并构造状态。该状态聚合策略应用于背包问题的每个问题实例,并与优势 actor-critic(A2C)算法结合,训练出一个策略,依此在每个时间步顺序地选择物品。该方法是一种构造式求解途径,选择物品的过程重复进行直至获得最终解。实验表明,我们的方法对所有测试实例均给出接近最优的解,优于贪婪算法,且能处理更大规模的实例,比已有的 DRL 方法更灵活。此外,结果表明,带有状态聚合策略的所提模型不仅给出更优的解,而且比无状态聚合的模型在更少的时间步内完成学习。

关键词

引用

@article{arxiv.2004.12117,
  title  = {A State Aggregation Approach for Solving Knapsack Problem with Deep Reinforcement Learning},
  author = {Reza Refaei Afshar and Yingqian Zhang and Murat Firat and Uzay Kaymak},
  journal= {arXiv preprint arXiv:2004.12117},
  year   = {2020}
}