基于强化学习的地下储层随机最优井控
机器学习
2022-07-12 v2 系统与控制
系统与控制
摘要
我们给出一个无模型强化学习(RL)框架的案例研究,用于求解给定参数不确定性分布与部分可观测系统中的随机最优控制。我们聚焦于鲁棒最优井控问题,这是地下储层管理领域研究活跃的主题。对于该问题,系统为部分可观测,因为数据仅在井位处可用。此外,由于可用现场数据的稀疏性,模型参数高度不确定。原则上,RL 算法能够学习最优动作策略——从状态到动作的映射——以最大化数值奖励信号。在深度 RL 中,这一从状态到动作的映射使用深度神经网络参数化。在鲁棒最优井控问题的 RL 表述中,状态由井位处的饱和度和压力值表示,而动作表示控制井中流动的阀门开度。数值奖励指总驱扫效率,不确定的模型参数为地下渗透率场。模型参数的不确定性通过引入一种利用其不确定性分布进行聚类分析的域随机化方案来处理。我们在两个代表两种不同渗透率场不确定性分布的地下流动测试用例上,使用两种前沿 RL 算法——近端策略优化(PPO)和优势 actor-critic(A2C)——给出了数值结果。结果通过与使用差分进化算法获得的优化结果进行基准对比。此外,我们通过在训练过程中未使用的、从参数不确定性分布中抽取的未见样本上评估所学控制策略,证明了所提 RL 用法的鲁棒性。
引用
@article{arxiv.2207.03456,
title = {Stochastic optimal well control in subsurface reservoirs using reinforcement learning},
author = {Atish Dixit and Ahmed H. ElSheikh},
journal= {arXiv preprint arXiv:2207.03456},
year = {2022}
}