中文

用于压水堆优化的多目标强化学习方法

机器学习 2024-03-19 v3 计算工程、金融与科学

摘要

一种新方法——结合强化学习的 Pareto 包络(PEARL)已被开发出来,以应对多目标问题带来的挑战,特别是在候选解评估可能非常耗时的工程领域。PEARL 通过学习单一策略,有别于传统的基于策略的多目标强化学习方法,消除了使用多个神经网络独立求解较简单子问题的需要。受深度学习和进化技术启发的几个版本已被设计出来,以适用于无约束和有约束的问题域。课程学习被用来在这些版本中有效地管理约束。PEARL 的性能首先在经典的多目标基准上进行评估。此外,它还在两个实际的压水堆堆芯装载模式优化问题上进行了测试,以展示其在现实世界中的适用性。第一个问题涉及将循环长度和棒积分峰值因子作为主要目标进行优化,而第二个问题将平均富集度作为额外目标纳入。此外,PEARL 处理了与硼浓度、峰值燃料棒燃耗和峰值燃料棒功率相关的三种约束。结果与传统方法进行了系统比较。值得注意的是,与具有缩放目标的单目标优化相比,PEARL,特别是 PEARL-NdS 变体,无需算法设计者付出额外努力即可高效地揭示 Pareto 前沿。它还在包括超体积在内的多个性能指标上优于经典方法。

关键词

引用

@article{arxiv.2312.10194,
  title  = {Multi-Objective Reinforcement Learning-based Approach for Pressurized Water Reactor Optimization},
  author = {Paul Seurin and Koroush Shirvan},
  journal= {arXiv preprint arXiv:2312.10194},
  year   = {2024}
}