中文

基于输入凸动作校正的离线强化学习安全部署

系统与控制 2025-07-31 v1 人工智能 机器学习 系统与控制 机器学习

摘要

离线强化学习( offline RL)为利用历史数据开发化学过程控制策略提供了希望框架,无需在线实验即可降低风险和成本。本 work 研究将离线 RL应用于放热聚合物连续搅拌釜反应器的安全高效控制。我们引入了一个兼容Gymnasium的仿真环境,捕捉反应器的非线性动力学,包括反应动力学、能量平衡和操作约束。该环境支持三种工业相关场景:启动、降级更改和升级更改。它还包括由比例-积分控制器随机调谐生成的可复现离线数据集,为在真实过程控制任务中评估离线 RL算法提供基准。我们评估了行为模仿和隐式Q学习作为基线算法,突出了离线代理面临的挑战,包括稳态偏移和在 setpoint 附近的性能下降。为解决这些问题,我们提出了一种 novel 的部署时安全层,使用输入凸神经网络(PICNN)作为学习的成本模型执行梯度-based 动作校正。PICNN通过在凸的、状态条件化的成本表面上进行梯度下降,实现对策略动作的实时、可微校正,无需重新训练或环境交互。实验结果表明,离线 RL,特别是结合凸动作校正后,可超越传统控制方法,在所有场景中保持稳定性。这些发现表明了将离线 RL与可解释且安全感知的校正集成以实现高风险化学过程控制的可行性,为工业系统更可靠的数据驱动自动化奠定了基础。

关键词

引用

@article{arxiv.2507.22640,
  title  = {Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction},
  author = {Alex Durkin and Jasper Stolte and Matthew Jones and Raghuraman Pitchumani and Bei Li and Christian Michler and Mehmet Mercangöz},
  journal= {arXiv preprint arXiv:2507.22640},
  year   = {2025}
}