中文

通过深度强化学习求解持续组合选择问题

机器学习 2019-09-10 v1 人工智能 机器学习

摘要

我们考虑每步选取一个物品子集的马尔可夫决策过程(MDP),称为 Select-MDP(S-MDP)。S-MDP 巨大的状态与动作空间使其难以用典型强化学习(RL)算法求解,尤其在物品数量极大时。本文提出一种深度 RL 算法,通过采用以下关键思路解决该问题。首先,我们将原 S-MDP 转化为迭代 Select-MDP(IS-MDP),其在最优动作上与 S-MDP 等价。IS-MDP 将同时选取 K 个物品的联合动作分解为 K 次迭代选取,以状态指数级增加为代价降低了动作数。其次,我们利用 IS-MDP 中一种特殊的对称性,借助新颖的权重共享 Q 网络克服状态空间爆炸,该网络可证明保持充分表达能力。多种实验表明,即便物品空间很大,我们的方法也表现良好,并且可扩展到训练所用物品空间不同的环境。

关键词

引用

@article{arxiv.1909.03638,
  title  = {Solving Continual Combinatorial Selection via Deep Reinforcement Learning},
  author = {Hyungseok Song and Hyeryung Jang and Hai H. Tran and Se-eun Yoon and Kyunghwan Son and Donggyu Yun and Hyoju Chung and Yung Yi},
  journal= {arXiv preprint arXiv:1909.03638},
  year   = {2019}
}

备注

Accepted to IJCAI 2019,14 pages,8 figures