强化学习算法在核电厂燃料优化中的评估
机器学习
2023-07-18 v2 计算物理
摘要
核燃料装载方案优化问题属于大规模组合优化问题,且具有多目标与多约束的特征,无法显式求解。包括遗传算法和模拟退火在内的随机优化方法已被不同的核公用事业单位和供应商使用,但手工设计的方案仍是业界主流方法。为改进现有技术,本文利用了深度强化学习(RL),特别是近端策略优化(Proximal Policy Optimization)。这项工作提出了一种首创的方法,利用深度RL求解装载方案问题,并可推广至任何工程设计优化。据我们所知,本文也是首篇提出研究影响RL算法的若干超参数行为的论文。该算法高度依赖于多种因素,例如为核心设计导出的目标函数形状,其充当影响学习稳定性的修正因子;还包括通过不同参数体现的探索/利用权衡,例如智能体每回合看到的装载方案数量、策略更新前收集的样本数nsteps,以及增加训练期间策略随机性的熵系数ent_coef。我们发现,RL的应用必须类似于高斯过程,其中采集函数被参数化策略替代。然后,一旦找到初始超参数集,逐步减小nsteps和ent_coef直至不再观察到学习,将稳健且稳定地带来最高的样本效率。这带来了每厂每年535,000至642,000美元的经济效益。
引用
@article{arxiv.2305.05812,
title = {Assessment of Reinforcement Learning Algorithms for Nuclear Power Plant Fuel Optimization},
author = {Paul Seurin and Koroush Shirvan},
journal= {arXiv preprint arXiv:2305.05812},
year = {2023}
}