恰当价值等价
人工智能
2021-12-14 v2 机器学习
摘要
基于模型的强化学习(RL)的主要挑战之一是决定应对环境的哪些方面进行建模。价值等价(VE)原理对这一问题给出了一个简单的答案:模型应捕捉基于价值的规划所相关的环境方面。从技术上讲,VE 基于一组策略与一组函数区分模型:若模型为这些策略所诱导的 Bellman 算子作用于这些函数时给出正确结果,则称该模型与环境 VE。随着策略与函数数量增加,VE 模型集合缩小,最终坍缩为对应完美模型的单点。因此,VE 原理背后的一个基本问题是如何选择足以用于规划的最小策略集与函数集。本文朝回答该问题迈出重要一步。我们首先将 VE 概念推广到关于 Bellman 算子 k 次应用的 k 阶对应概念,这导出随 k → ∞ 而增大的 VE 类族。在极限下,所有函数变为价值函数,我们得到 VE 的一个特殊实例,称之为恰当 VE 或简称 PVE。与 VE 不同,即便在使用所有价值函数的极限下,PVE 类也可能包含多个模型。关键在于,所有这些模型都足以用于规划,意味着尽管它们可能忽略环境的许多方面,仍将产生最优策略。我们构造了用于学习 PVE 模型的损失函数,并论证 MuZero 等流行算法可被理解为最小化该损失的上界。我们利用这一联系对 MuZero 提出修改,并表明其在实践中可带来性能提升。
引用
@article{arxiv.2106.10316,
title = {Proper Value Equivalence},
author = {Christopher Grimm and André Barreto and Gregory Farquhar and David Silver and Satinder Singh},
journal= {arXiv preprint arXiv:2106.10316},
year = {2021}
}