学习不该学什么:基于深度强化学习的动作消除
机器学习
2019-02-26 v3 机器学习
摘要
当每个状态存在许多可用动作时,学习如何行动对强化学习(RL)智能体是一项挑战性任务,尤其是当许多动作冗余或无关时。在此类情况下,学习哪些动作不应采取有时更容易。在本工作中,我们提出动作消除深度Q网络(AE-DQN)架构,其将深度RL算法与消除次优动作的动作消除网络(AEN)相结合。AEN受环境提供的外部消除信号监督,训练以预测无效动作。仿真在具有超过一千个离散动作的基于文本的游戏中展示了相比原始DQN的显著加速与额外鲁棒性。
引用
@article{arxiv.1809.02121,
title = {Learn What Not to Learn: Action Elimination with Deep Reinforcement Learning},
author = {Tom Zahavy and Matan Haroush and Nadav Merlis and Daniel J. Mankowitz and Shie Mannor},
journal= {arXiv preprint arXiv:1809.02121},
year = {2019}
}