基于Y型仿射神经网络的强化学习控制
系统与控制
2026-05-21 v1 机器学习
系统与控制
最优化与控制
摘要
本文提出了一种基于Y型仿射神经网络(YANNs)的新型强化学习(RL)算法。YANNs提供一种可解释的神经网络,能够精确表示在任意输入和输出维度上、在任意数量的多边形子域上定义的分段仿射函数。YANNs的一个典型应用是重新表述多参数线性模型预测控制的显式解。基于此,我们提出使用YANNs来初始化RL演员和评论家网络,这使得基于YANNs的RL控制算法能够以线性最优控制的信心开始。YANN-演员通过表示通过离线计算获得的多参数控制解来初始化,这些解来自于近似线性系统模型。YANN-评论家代表了线性系统和奖励函数作为最优控制问题(OCP)中状态-动作价值函数的显式形式。通过注入额外的网络层来扩展YANNs,以处理非线性表达式,这些网络可以在在线训练时直接与真实的复杂非线性系统交互。如此一来,策略和状态价值函数最初完全表示线性OCP的解,并且能够最终学习一般非线性OCP的解。还实现了连续的策略改进,以提供演员策略性能的下界的启发式信心。YANN-RL算法在夹接摆锤和安全关键的化学反应系统上进行了演示。我们的结果表明,YANN-RL在考虑安全约束时,显著优于使用深度确定性策略梯度的现代RL算法。
引用
@article{arxiv.2508.16474,
title = {Reinforcement Learning-based Control via Y-wise Affine Neural Networks (YANNs)},
author = {Austin Braniff and Yuhe Tian},
journal= {arXiv preprint arXiv:2508.16474},
year = {2026}
}