用于高维状态与动作的组合马尔可夫决策过程(Slate-MDP)的带注意力深度强化学习
人工智能
2015-12-17 v2 人机交互
机器学习
摘要
许多现实世界的问题伴随着以特征向量表示的动作空间。尽管高维控制在很大程度上是一个未解决的问题,但近期在适中维度上取得了进展。在此我们报告了一次成功尝试,解决了特定形式下维度高达 的问题。受诸如不符合标准强化学习框架的推荐系统等重要应用的启发,我们引入了组合马尔可夫决策过程(Slate-MDP)。组合马尔可夫决策过程(Slate-MDP)是一种具有组合动作空间的MDP,该空间由基本动作的组合(元组)构成,其中一个在底层MDP中被执行。智能体不控制该被执行动作的选择,且该动作甚至可能不在组合内,例如对于可忽略所有推荐的推荐系统。我们使用基于状态和动作特征表示的深度Q学习来学习整个组合的价值。与现有方法不同,我们同时优化任务的组合与序列方面。新智能体相对于忽略组合或序列长期价值方面的智能体的优越性,在一系列具有现实世界推荐系统动力的环境中得到了证明。此外,我们使用深度确定性策略梯度来学习一个策略,该策略对于组合的每个位置,将注意力引导至动作空间中价值最高的部分,并且我们仅在该区域内评估动作。该注意力被用于利用子模性的顺序贪婪过程中。最后,我们展示了引入风险寻求如何能显著改善智能体的性能以及发现更具长远影响策略的能力。
引用
@article{arxiv.1512.01124,
title = {Deep Reinforcement Learning with Attention for Slate Markov Decision Processes with High-Dimensional States and Actions},
author = {Peter Sunehag and Richard Evans and Gabriel Dulac-Arnold and Yori Zwols and Daniel Visentin and Ben Coppin},
journal= {arXiv preprint arXiv:1512.01124},
year = {2015}
}