基于最大熵 mellowmax 情景控制的样本高效强化学习
机器学习
2019-11-22 v1 神经与进化计算
机器学习
摘要
深度网络使强化学习能够扩展到更复杂和更具挑战性的领域,但这些方法通常需要大量的训练数据。一种替代方案是使用样本高效的情景控制方法:这类受神经启发的算法采用非参数或半参数模型,通过存储和检索先前经历的转移来预测价值。进一步提高这些方法样本效率的一种途径是使用更具原则性的探索策略。为此,本文提出最大熵 mellowmax 情景控制(MEMEC),其依据具有状态相关温度的玻尔兹曼策略对动作进行采样。我们证明,在经典强化学习环境和 Atari 游戏上,MEMEC 优于其他基于不确定性和 softmax 的探索方法,实现了更快速的学习和更高的最终奖励。
引用
@article{arxiv.1911.09615,
title = {Sample-Efficient Reinforcement Learning with Maximum Entropy Mellowmax Episodic Control},
author = {Marta Sarrico and Kai Arulkumaran and Andrea Agostinelli and Pierre Richemond and Anil Anthony Bharath},
journal= {arXiv preprint arXiv:1911.09615},
year = {2019}
}
备注
Workshop on Biological and Artificial Reinforcement Learning, NeurIPS 2019