避免价值函数近似中预测器与抑制器的混淆
人工智能
2015-02-19 v2
摘要
在强化学习中,目标是寻求奖励并避免惩罚。一个简单的标量捕捉了状态或采取行动的价值,其中期望的未来奖励增加而惩罚减少这个量。自然地,智能体应该学习预测这个量以采取有益的行动,并且存在许多价值函数近似器用于此目的。然而,在本文中,我们展示了价值函数近似器如何导致对一种效价结果(例如,奖励信号)的预测器与相反效价的抑制器(例如,取消惩罚期望的信号)之间的混淆。我们证明这对于线性和非线性价值函数近似器都是一个难题,尤其是在数据(或经验)量有限时。我们提出并评估了一个简单的解决方案:分别预测奖励和惩罚值,然后整流并相加得到决策所需的价值。我们在这种略有不同的价值函数近似架构中评估了几种函数近似器,并表明这种方法能够避免混淆,从而实现更低的价值预测误差。
引用
@article{arxiv.1312.5714,
title = {Avoiding Confusion between Predictors and Inhibitors in Value Function Approximation},
author = {Patrick C. Connor and Thomas P. Trappenberg},
journal= {arXiv preprint arXiv:1312.5714},
year = {2015}
}
备注
14 pages, 3 figures, 23 references, Workshop paper in ICLR 2014 (updated based on reviewer comments)