基于模型的强化学习中的价值等价原理
机器学习
2020-11-09 v1 人工智能
摘要
从数据学习环境模型通常被视为构建智能强化学习(RL)智能体的关键组成部分。常见做法是将模型的学习与其使用分离,通过构建正确预测观测状态转移的环境动力学模型来实现。本文认为,基于模型的 RL 智能体有限的表示资源更应被用于构建对基于价值的规划直接有用的模型。作为主要贡献,我们引入价值等价原理:两个模型相对于一组函数和策略是价值等价的,当且仅当它们产生相同的贝尔曼更新。我们提出基于价值等价原理的模型学习问题表述,并分析可行解集合如何受策略和函数选择的影响。具体而言,我们表明,随着所考虑策略和函数集合的扩充,价值等价模型类会收缩,直至最终坍缩为对应完美描述环境的单一模型点。在许多问题中,直接建模状态到状态的转移可能既困难又不必要。利用价值等价原理,可以在不损害性能的前提下找到更简单的模型,从而节省计算与内存。我们通过实验将该价值等价模型学习与最大似然估计等传统对应方法比较,阐明了其益处。更一般地,我们认为价值等价原理构成了 RL 中若干近期经验成功(如 Value Iteration Networks、Predictron、Value Prediction Networks、TreeQN 和 MuZero)的基础,并为这些结果提供了首个理论依据。
引用
@article{arxiv.2011.03506,
title = {The Value Equivalence Principle for Model-Based Reinforcement Learning},
author = {Christopher Grimm and André Barreto and Satinder Singh and David Silver},
journal= {arXiv preprint arXiv:2011.03506},
year = {2020}
}
备注
NeurIPS-2020