基于互信息估计的赋能驱动探索
机器学习
2018-10-15 v1 人工智能
机器学习
摘要
探索是强化学习中的难题,在稀疏奖励环境中尤为重要。然而,许多依赖 epsilon-greedy 的先进深度强化学习算法在此类环境中表现不佳。在此情形下,赋能可作为内在奖励信号,使智能体最大化其对近期未来的影响力。我们将赋能表述为状态与动作间的信道容量,并通过估计动作与后续状态间的互信息来计算。互信息使用互信息神经估计器与前向动力学模型进行估计。我们证明,在 Montezuma's Revenge 游戏中,赋能驱动的智能体能够显著改善基线 DQN 智能体的得分。
引用
@article{arxiv.1810.05533,
title = {Empowerment-driven Exploration using Mutual Information Estimation},
author = {Navneet Madhu Kumar},
journal= {arXiv preprint arXiv:1810.05533},
year = {2018}
}
备注
Preprint. Under Development. arXiv admin note: text overlap with arXiv:1807.02078 by other authors