用内在恐惧对抗强化学习的西西弗斯诅咒
机器学习
2018-03-15 v8 神经与进化计算
机器学习
摘要
许多实际环境包含灾难性状态,最优智能体很少或永远不会访问这些状态。即使在玩具问题上,深度强化学习(DRL)智能体在新策略下遗忘这些状态存在后,也倾向于周期性地重访它们。我们引入内在恐惧(IF),一种学习到的奖励塑造,用以保护 DRL 智能体免受周期性灾难。IF 智能体拥有一个经过训练可预测迫近灾难概率的恐惧模型。该分数随后被用于惩罚 Q 学习目标。我们的理论分析界定了因在扰动目标上学习而导致的平均回报减少量。我们还证明了对于分类错误的鲁棒性。作为额外好处,由于奖励塑造,IF 模型往往学习得更快。实验表明,内在恐惧 DQN 解决了原本病态的环境,并在数款 Atari 游戏上取得改进。
引用
@article{arxiv.1611.01211,
title = {Combating Reinforcement Learning's Sisyphean Curse with Intrinsic Fear},
author = {Zachary C. Lipton and Kamyar Azizzadenesheli and Abhishek Kumar and Lihong Li and Jianfeng Gao and Li Deng},
journal= {arXiv preprint arXiv:1611.01211},
year = {2018}
}