我为何该信任你,贝尔曼?贝尔曼误差是价值误差的糟糕替代
机器学习
2022-06-30 v2 人工智能
机器学习
摘要
在本工作中,我们研究将贝尔曼方程用作价值预测准确性的代理目标。尽管贝尔曼方程在所有状态-动作对上由真实价值函数唯一求解,我们发现贝尔曼误差(方程两侧之差)是价值函数准确性的糟糕代理。具体而言,我们表明:(1) 由于贝尔曼方程两侧的抵消,即便考虑所有状态-动作对,贝尔曼误差的大小与到真实价值函数的距离也仅有微弱关联;(2) 在有限数据情形下,贝尔曼方程可被无穷多个次优解精确满足。这意味着贝尔曼误差可被最小化而无需提升价值函数的准确性。我们通过一系列命题、说明性玩具示例以及标准基准域中的实证分析展示了这些现象。
引用
@article{arxiv.2201.12417,
title = {Why Should I Trust You, Bellman? The Bellman Error is a Poor Replacement for Value Error},
author = {Scott Fujimoto and David Meger and Doina Precup and Ofir Nachum and Shixiang Shane Gu},
journal= {arXiv preprint arXiv:2201.12417},
year = {2022}
}
备注
ICML 2022