基于 Koopman 算子的黎巴比-本利对流的强化学习控制代理建模
机器学习
2026-03-31 v1 动力系统
摘要
训练控制流体动力学系统的强化学习 (RL) 智能体由于求解方程的直接数值模拟 (DNS) 成本高昂而代价高昂。代理模型作为在计算成本较低 fraction 下近似动态行为的替代方案,然而由于策略诱导的状态分布超出代理训练数据所覆盖的分布,限制了其作为 RL 训练环境的可行性。本文我们研究使用线性循环自编码器网络 (LRANs) 加速 2D 黎巴比-本利对流的 RL 基于控制的建模。我们评估了两种训练策略:一种是基于随机动作生成的预计算数据训练的代理模型,另一种是基于不断演化的策略收集的数据迭代训练的策略感知代理模型。我们的结果表明,虽然仅使用代理模型的训练导致控制性能下降,但将代理模型与 DNS 结合的预训练方案在保持最先进性能的同时,将训练时间缩短了 40% 以上。我们演示了策略感知训练可缓解分布偏移的影响,使代理模型在策略相关状态空间区域能够进行更准确的预测。
关键词
引用
@article{arxiv.2603.28074,
title = {Koopman-based surrogate modeling for reinforcement-learning-control of Rayleigh-Benard convection},
author = {Tim Plotzki and Sebastian Peitz},
journal= {arXiv preprint arXiv:2603.28074},
year = {2026}
}