面向实际引擎控制的安全强化学习
机器学习
2026-02-25 v2 人工智能
摘要
本工作引入了针对安全关键实际环境应用强化学习(RL)的工具链,具体采用深度确定性策略梯度(DDPG)算法。以单缸内燃机测试平台的暂态负荷控制为例,在均匀燃烧压缩点火(HCCI)模式下实现演示,该模式具有高热效率和低排放。然而,HCCI 因其非线性、自回归和随机性质,传统控制方法面临挑战。虽然 RL 提供了可行解决方案,但在应用于 HCCI 时必须解决安全问题,如过高的压力上升率。单一次不适当的控制输入可能损坏发动机或导致失火停机。此外,运行限制无法预先确定,需通过实验得出。为缓解这些风险,实现了基于 k 近邻算法的实时安全监控,使可安全地与测试平台交互。本案例的可行性通过 RL 智能体与测试平台交互学习控制策略得以演示。实现指示均有效压力的均方根误差为 0.1374 bar,与文献中基于神经网络的控制器相当。进一步演示了该工具链的灵活性,通过调整智能体策略以提高乙醇能源比例,在保持安全的前提下促进可再生燃料的使用。本 RL 方法解决了将 RL 应用于安全关键实际环境的长期难题。该工具链凭借其可适应性和安全机制,为未来在发动机测试平台及其他安全关键场景中应用 RL 铺平了道路。
引用
@article{arxiv.2501.16613,
title = {Safe Reinforcement Learning for Real-World Engine Control},
author = {Julian Bedei and Lucas Koch and Kevin Badalian and Alexander Winkler and Patrick Schaber and Jakob Andert},
journal= {arXiv preprint arXiv:2501.16613},
year = {2026}
}