势能塑造与Q值初始化等价性证明
机器学习
2011-06-28 v1
摘要
塑造已被证明是提升强化学习性能的一种强大但危险的手段。Ng、Harada和Russell(1999)提出了基于势能的塑造算法,以在保证学习者学到最优行为的前提下添加塑造奖励。本文证明了该塑造算法与若干强化学习算法所需初始化步骤之间的某些相似性。更具体地说,我们证明,一个初始Q值基于塑造算法势能函数的强化学习器,在整个学习过程中所做的更新与一个接收基于势能的塑造奖励的学习器相同。我们进一步证明,在一大类策略下,这两个学习器的行为不可区分。该比较为塑造算法的理论性质提供了直观理解,并为一种捕获该算法收益的更简单方法提供了建议。此外,该等价性还引发了关于基于势能的塑造学习效率方面此前未被关注的问题。
引用
@article{arxiv.1106.5267,
title = {Potential-Based Shaping and Q-Value Initialization are Equivalent},
author = {E. Wiewiora},
journal= {arXiv preprint arXiv:1106.5267},
year = {2011}
}