中文

基于互信息估计的赋能驱动探索

机器学习 2018-10-15 v1 人工智能 机器学习

摘要

探索是强化学习中的难题,在稀疏奖励环境中尤为重要。然而,许多依赖 epsilon-greedy 的先进深度强化学习算法在此类环境中表现不佳。在此情形下,赋能可作为内在奖励信号,使智能体最大化其对近期未来的影响力。我们将赋能表述为状态与动作间的信道容量,并通过估计动作与后续状态间的互信息来计算。互信息使用互信息神经估计器与前向动力学模型进行估计。我们证明,在 Montezuma's Revenge 游戏中,赋能驱动的智能体能够显著改善基线 DQN 智能体的得分。

关键词

引用

@article{arxiv.1810.05533,
  title  = {Empowerment-driven Exploration using Mutual Information Estimation},
  author = {Navneet Madhu Kumar},
  journal= {arXiv preprint arXiv:1810.05533},
  year   = {2018}
}

备注

Preprint. Under Development. arXiv admin note: text overlap with arXiv:1807.02078 by other authors