CASA:以冲突规避策略迭代弥合策略改进与策略评估之间的鸿沟
机器学习
2023-02-28 v5 人工智能
摘要
我们研究无模型强化学习问题,该问题通常遵循广义策略迭代(GPI)原则求解。尽管 GPI 通常是策略评估与策略改进之间的相互作用,但大多数传统无模型方法假定 GPI 步骤的粒度及其他细节相互独立,忽视了它们之间固有的联系。本文中,我们提出一种正则化策略评估与策略改进之间不一致性的方法,从而得到一种具有更小函数逼近误差的冲突规避 GPI 解。为此,我们构建了一种新的学习范式,其中执行策略评估步骤等价于对执行策略改进的一种补偿,从而有效缓解了两个 GPI 步骤之间的梯度冲突。我们还表明,我们所提解的形式等价于执行熵正则化策略改进,因此可防止策略陷入次优解。我们在街机学习环境(ALE)上进行了大量实验来评估我们的方法。实证结果表明,我们的方法在主要评估领域中优于若干强基线。
引用
@article{arxiv.2105.03923,
title = {CASA: Bridging the Gap between Policy Improvement and Policy Evaluation with Conflict Averse Policy Iteration},
author = {Changnan Xiao and Haosen Shi and Jiajun Fan and Shihong Deng and Haiyan Yin},
journal= {arXiv preprint arXiv:2105.03923},
year = {2023}
}
备注
26 pages. This version was rejected by ICLR2023 and contains the rebuttal content