带工具变量的最小二乘策略迭代与直接策略搜索:基于储能的最优基准对比
最优化与控制
2014-01-07 v1 机器学习
摘要
本文研究了使用最小二乘 Bellman 误差最小化进行策略评估的近似策略迭代 (API) 方法。我们探讨了其几种增强形式,即使用工具变量的 Bellman 误差最小化、最小二乘投影 Bellman 误差最小化以及使用工具变量的投影 Bellman 误差最小化。我们证明,对于一般的离散时间随机控制问题,使用工具变量的 Bellman 误差最小化等价于投影 Bellman 误差最小化的两种变体。这些 API 方法的一种替代方案是基于知识梯度的直接策略搜索。随后,我们在储能应用的背景下研究了这三种近似动态规划方法的实际性能,该应用集成了间歇性风能供应,以完全满足随机时变的电力需求。我们利用真实世界数据创建了一个测试问题库,并应用值迭代来寻找其最优策略。这些基准随后被用于比较所开发的策略。我们的分析表明,带有工具变量 Bellman 误差最小化的 API 显著优于带有最小二乘 Bellman 误差最小化的 API。然而,这些方法的表现不及我们的直接策略搜索实现。
引用
@article{arxiv.1401.0843,
title = {Least Squares Policy Iteration with Instrumental Variables vs. Direct Policy Search: Comparison Against Optimal Benchmarks Using Energy Storage},
author = {Warren R. Scott and Warren B. Powell and Somayeh Moazehi},
journal= {arXiv preprint arXiv:1401.0843},
year = {2014}
}
备注
37 pages, 9 figures