中文

Fill-and-Spill:用于水库运行决策与控制的深度强化学习策略梯度方法

机器学习 2024-03-08 v1 最优化与控制

摘要

需求变化、各种水文输入以及环境压力源是水资源管理者和政策制定者经常面临的问题。这些关切引发了人们对应用不同技术来确定水库运行策略决策的兴趣。随着分析分辨率的提高,使用动态规划 (DP) 和随机动态规划 (SDP) 等传统方法有效地表示现实世界系统以确定最佳水库运行策略变得更加困难。挑战之一是“维数灾难”,这意味着以给定精度估计任意函数所需的样本数量随函数输入变量(即维数)的数量呈指数增长。深度强化学习 (DRL) 是一种智能方法,可克服水库运行策略决策中随机优化问题的诅咒。据我们所知,本研究是首次尝试考察各种新颖的 DRL 连续动作策略梯度方法 (PGMs),包括深度确定性策略梯度 (DDPG)、双延迟 DDPG (TD3) 以及两个不同版本的软演员 - 评论家 (SAC18 和 SAC19),以优化水库运行策略。在本研究中,实施了多种 DRL 技术,以寻找美国加利福尼亚州 Folsom 水库的最佳运行策略。该水库系统为萨克拉门托市提供农业、市政、水力发电和环境流量需求以及防洪操作。分析表明,TD3 和 SAC 能够稳健地满足 Folsom 水库的需求并优化水库运行策略。

关键词

引用

@article{arxiv.2403.04195,
  title  = {Fill-and-Spill: Deep Reinforcement Learning Policy Gradient Methods for Reservoir Operation Decision and Control},
  author = {Sadegh Sadeghi Tabas and Vidya Samadi},
  journal= {arXiv preprint arXiv:2403.04195},
  year   = {2024}
}