中文

地质导向中的最优序贯决策:一种强化学习方法

机器学习 2025-01-23 v2 人工智能 地球物理

摘要

贯穿钻井过程的轨迹调整决策称为地质导向,它影响后续的抉择与信息收集,从而构成一个耦合的序贯决策问题。先前将决策优化方法应用于地质导向的工作依赖于贪婪优化或近似动态规划(ADP)。这两种决策优化方法均需显式的不确定性与目标函数模型,使得为复杂且真实的地质导向环境开发决策优化方法困难乃至不可能。我们使用 Deep Q-Network(DQN)方法,一种直接从决策环境学习的无模型强化学习(RL)方法,来优化地质导向决策。RL 的昂贵计算在离线训练阶段完成。用于实时决策支持的 DQN 评估耗时毫秒级,快于传统替代方案。此外,对于两个先前发布的合成地质导向场景,我们的结果表明 RL 取得了与准最优 ADP 相当的高质量结果。然而,RL 的无模型特性意味着通过替换训练环境,我们可将其扩展至 ADP 求解计算代价过高的问题。这种灵活性将允许将其应用于更复杂的环境,并在未来制作用真实数据训练的混合版本。

关键词

引用

@article{arxiv.2310.04772,
  title  = {Optimal Sequential Decision-Making in Geosteering: A Reinforcement Learning Approach},
  author = {Ressi Bonti Muhammad and Sergey Alyaev and Reidar Brumer Bratvold},
  journal= {arXiv preprint arXiv:2310.04772},
  year   = {2025}
}