基于模型的强化学习自适应光学控制实验室实验
天体物理仪器与方法
2024-01-02 v1 机器学习
机器人学
摘要
直接成像类地系外行星是下一代地基望远镜最主要的科学驱动力之一。通常,类地系外行星与其宿主恒星的角距离很小,这使得探测变得困难。因此,必须精心设计自适应光学(AO)系统的控制算法,以将系外行星与宿主恒星产生的残余光区分开来。改进 AO 控制的一个有前景的新研究方向是建立在数据驱动控制方法(如强化学习,RL)之上。RL 是机器学习研究领域的一个活跃分支,其中系统控制是通过与环境交互学习得到的。因此,RL 可被视为一种自动化的 AO 控制方法,其使用完全是交钥匙操作。特别是,基于模型的强化学习(MBRL)已被证明能够应对时间误差和配准误差。同样,它也被证明能够适应非线性波前传感,同时在训练和执行方面具有高效性。在这项工作中,我们在欧洲南方天文台(ESO)总部的 GHOST 测试平台上实现并调整了一种称为 PO4AO(Policy Optimization for AO)的 RL 方法,展示了该方法在实验室环境中的强大性能。我们的实现允许训练与推理并行进行,这对于天基观测操作至关重要。特别是,我们研究了该方法的预测性和自校准特性。在 GHOST 上运行的新实现基于 PyTorch,仅在硬件、流水线和 Python 接口延迟的基础上增加了约 700 微秒。我们开源了文档完善的实现代码,并规定了实时控制器(RTC)流水线的要求。我们还讨论了该方法的重要超参数、延迟来源以及实现更低延迟的可能途径。
引用
@article{arxiv.2401.00242,
title = {Laboratory Experiments of Model-based Reinforcement Learning for Adaptive Optics Control},
author = {Jalo Nousiainen and Byron Engler and Markus Kasper and Chang Rajani and Tapio Helin and Cédric T. Heritier and Sascha P. Quanz and Adrian M. Glauser},
journal= {arXiv preprint arXiv:2401.00242},
year = {2024}
}
备注
Accepted for publication in JATIS