学着做还是边做边学:用于在线连续调谐的强化学习与贝叶斯优化
机器学习
2023-06-07 v1 人工智能
加速器物理
摘要
真实世界装置的在线调谐是一个复杂的优化问题,持续需要经验丰富的操作员手动干预。自主调谐是一个快速扩展的研究领域,其中基于学习的方法,如强化学习训练的优化(RLO)和贝叶斯优化(BO),在实现卓越装置性能和缩短调谐时间方面大有前景。然而,在不同场景下选择哪种算法仍是一个开放问题。本文以真实粒子加速器中的一项常规任务为例进行比较研究,表明 RLO 通常优于 BO,但并非总是最佳选择。基于研究结果,我们提供了一组明确的标准,以指导给定调谐任务的算法选择。这些标准可简化基于学习的自主调谐方案在复杂真实世界装置运行中的采用,最终提升这些设施的可用性并拓展其可操作极限,从而推动科学与工程的进步。
引用
@article{arxiv.2306.03739,
title = {Learning to Do or Learning While Doing: Reinforcement Learning and Bayesian Optimisation for Online Continuous Tuning},
author = {Jan Kaiser and Chenran Xu and Annika Eichler and Andrea Santamaria Garcia and Oliver Stein and Erik Bründermann and Willi Kuropka and Hannes Dinter and Frank Mayet and Thomas Vinatier and Florian Burkart and Holger Schlarb},
journal= {arXiv preprint arXiv:2306.03739},
year = {2023}
}
备注
17 pages, 8 figures, 2 tables