结合奖励最大化与赋能的统一贝尔曼最优原理
机器学习
2020-01-09 v5 人工智能
机器学习
摘要
赋能是一种信息论方法,可用于对学习智能体进行内在激励。它试图通过鼓励访问具有大量可达下一状态的状态,来最大化智能体对环境的控制。已有研究表明,赋能学习可在无需显式奖励信号的情况下产生复杂行为。本文中,我们研究在存在外在奖励信号时赋能的使用。我们假设赋能可通过鼓励高赋能状态来引导强化学习(RL)智能体找到良好的早期行为解。我们提出了一种用于赋能奖励最大化的统一贝尔曼最优原理。我们的赋能奖励最大化方法推广了贝尔曼最优原理及其近期的信息论扩展。我们证明了赋能值的唯一性并展示了向最优解的收敛。随后我们将该思想应用于开发离策略 actor-critic RL 算法,并在高维连续机器人领域(MuJoCo)中进行了验证。与无模型最先进技术相比,我们的方法展现出改进的初始性能和具有竞争力的终期性能。
引用
@article{arxiv.1907.12392,
title = {A Unified Bellman Optimality Principle Combining Reward Maximization and Empowerment},
author = {Felix Leibfried and Sergio Pascual-Diaz and Jordi Grau-Moya},
journal= {arXiv preprint arXiv:1907.12392},
year = {2020}
}
备注
Proceedings of the 33rd Conference on Neural Information Processing Systems (NeurIPS), Vancouver, Canada, 2019