通过深度强化学习求解持续组合选择问题
机器学习
2019-09-10 v1 人工智能
机器学习
摘要
我们考虑每步选取一个物品子集的马尔可夫决策过程(MDP),称为 Select-MDP(S-MDP)。S-MDP 巨大的状态与动作空间使其难以用典型强化学习(RL)算法求解,尤其在物品数量极大时。本文提出一种深度 RL 算法,通过采用以下关键思路解决该问题。首先,我们将原 S-MDP 转化为迭代 Select-MDP(IS-MDP),其在最优动作上与 S-MDP 等价。IS-MDP 将同时选取 K 个物品的联合动作分解为 K 次迭代选取,以状态指数级增加为代价降低了动作数。其次,我们利用 IS-MDP 中一种特殊的对称性,借助新颖的权重共享 Q 网络克服状态空间爆炸,该网络可证明保持充分表达能力。多种实验表明,即便物品空间很大,我们的方法也表现良好,并且可扩展到训练所用物品空间不同的环境。
引用
@article{arxiv.1909.03638,
title = {Solving Continual Combinatorial Selection via Deep Reinforcement Learning},
author = {Hyungseok Song and Hyeryung Jang and Hai H. Tran and Se-eun Yoon and Kyunghwan Son and Donggyu Yun and Hyoju Chung and Yung Yi},
journal= {arXiv preprint arXiv:1909.03638},
year = {2019}
}
备注
Accepted to IJCAI 2019,14 pages,8 figures