贝尔曼残差是一个糟糕的代理指标吗?
机器学习
2017-12-13 v3 机器学习
摘要
本文旨在从理论和实证上比较强化学习的两个标准优化准则:i) 均值最大化 和 ii) 贝尔曼残差最小化。为此,我们将自己置于通常设计用于最大化均值的策略搜索算法框架中,并推导出一种在策略上最小化残差 的方法。理论分析表明该代理指标对策略优化的效果如何,特别是它优于其基于值的对应指标。我们还提出了在随机生成的通用马尔可夫决策过程上的实验,这些实验专门设计用于研究所涉及的可集中性系数的影响。实验表明,贝尔曼残差通常是策略优化的一个糟糕代理指标,直接最大化均值要好得多,尽管目前缺乏深入的理论分析。这似乎显而易见,因为直接解决感兴趣的问题通常更好,但鉴于(投影)贝尔曼残差最小化在基于值的强化学习中的普遍性,我们认为这个问题值得考虑。
引用
@article{arxiv.1606.07636,
title = {Is the Bellman residual a bad proxy?},
author = {Matthieu Geist and Bilal Piot and Olivier Pietquin},
journal= {arXiv preprint arXiv:1606.07636},
year = {2017}
}
备注
Final NIPS 2017 version (title, among other things, changed)