通过强化学习实现化学积分自主自适应求解器选择
机器学习
2026-04-02 v1
摘要
刚性化学动力学的计算成本仍然是反应流模拟中的主要瓶颈,但混合积分策略通常由手工调优的启发式方法或监督预测器驱动,它们仅从瞬时局部状态做出短视决策。我们引入了一个约束强化学习(RL)框架,在化学积分过程中自主选择隐式BDF积分器(CVODE)和准稳态(QSS)求解器。求解器选择被建模为马尔可夫决策过程。智能体学习轨迹感知策略,考虑当前求解器选择如何影响下游误差累积,同时在用户规定的精度容差下最小化计算成本,该容差通过具有在线乘子自适应的Lagrangian奖励来强制执行。在采样的0D均匀反应器条件下,RL自适应策略实现了约3倍的平均加速,加速范围从1.11倍到10.58倍,同时保持了106种物质n-十二烷机制的准确点火延迟和物种谱,增加了约1%的推理开销。无需重新训练,从0D训练的策略迁移到1D逆流扩散火焰,在应变率10–2000 s⁻¹范围内,一致地实现了约2.2倍相对于CVODE的加速,同时保持了接近参考的温度准确性,并且仅在12–15%的时空点上选择CVODE。总体而言,这些结果展示了所提出的强化学习框架在学习问题特定积分策略的同时遵守精度约束的潜力,从而为具有空间异质性刚度的多物理场系统开辟了自适应、自优化工作流的路径。
引用
@article{arxiv.2604.00264,
title = {Autonomous Adaptive Solver Selection for Chemistry Integration via Reinforcement Learning},
author = {Eloghosa Ikponmwoba and Opeoluwa Owoyele},
journal= {arXiv preprint arXiv:2604.00264},
year = {2026}
}