基于深度强化学习的规定式狄利克雷功率分配策略
机器学习
2022-01-24 v1 人工智能
摘要
基于系统状态规定最优运行,从而潜在地延长剩余可用寿命,对于主动管理复杂系统的可用性、维护与成本具有巨大潜力。强化学习(RL)算法因其学习能力尤为适合此类问题。规定式运行的一个特例是功率分配任务,可视为序列分配问题,其动作空间受单纯形约束限制。此类序列分配问题的一般连续动作空间解对 RL 算法而言仍是开放研究问题。在连续动作空间中,强化学习的标准高斯策略不支持单纯形约束,而高斯-softmax 策略在训练中引入偏差。本工作中,我们提出用于连续分配任务的狄利克雷策略,并分析其策略梯度的偏差与方差。我们证明狄利克雷策略无偏,且相比高斯-softmax 策略提供显著更快收敛、更优性能及更好超参数鲁棒性。此外,我们在规定式运行案例中展示了所提算法的适用性,提出狄利克雷功率分配策略,并在一组多个锂离子(Li-I)电池系统的案例研究中评估性能。实验结果显示了规定最优运行、提升多电源系统效率与可持续性的潜力。
引用
@article{arxiv.2201.08445,
title = {A Prescriptive Dirichlet Power Allocation Policy with Deep Reinforcement Learning},
author = {Yuan Tian and Minghao Han and Chetan Kulkarni and Olga Fink},
journal= {arXiv preprint arXiv:2201.08445},
year = {2022}
}