中文

基于强化学习的混合整数最优控制:以混合动力汽车能量管理为例

系统与控制 2024-06-03 v3 人工智能 系统与控制

摘要

许多最优控制问题需要同时输出离散与连续控制变量。这些问题通常被表述为混合整数最优控制(MIOC)问题,由于解空间的复杂性而难以求解。分支定界等数值方法计算开销大,不利于实时控制。本文提出一种新颖的混合动作强化学习(HARL)算法——双延迟深度确定性actor-Q(TD3AQ),用于MIOC问题。TD3AQ结合了actor-critic与Q-learning方法的优势,可同时处理离散与连续动作空间。所提算法在一个插电式混合动力汽车(PHEV)能量管理问题上进行了评估,其中离散变量(离合器接合/分离与换挡)和连续变量(发动机扭矩)的实时控制对于在满足驾驶约束下最大化燃油经济性至关重要。仿真结果表明,与动态规划(DP)相比,TD3AQ取得的控制结果接近最优,差异仅4.69%;并且其性能超越了基线强化学习算法。

关键词

引用

@article{arxiv.2305.01461,
  title  = {Mixed-Integer Optimal Control via Reinforcement Learning: A Case Study on Hybrid Electric Vehicle Energy Management},
  author = {Jinming Xu and Nasser Lashgarian Azad and Yuan Lin},
  journal= {arXiv preprint arXiv:2305.01461},
  year   = {2024}
}