中文

利用拉格朗日对偶高效训练深度学习参数化策略

机器学习 2025-02-21 v2 最优化与控制

摘要

约束马尔可夫决策过程(CMDP)在许多高风险应用中至关重要,其中决策必须优化累积奖励同时严格遵守复杂的非线性约束。在电力系统、金融、供应链和精密机器人等领域,违反这些约束可能导致重大的财务或社会成本。现有的强化学习(RL)方法在处理高度严格约束的CMDP时,往往在样本效率和寻找可行策略的有效性方面存在困难,限制了它们在这些环境中的适用性。随机对偶动态规划常用于原始问题的凸松弛,但也面临计算挑战和最优性损失。本文提出了一种新方法,即两阶段深度决策规则(TS-DDR),利用拉格朗日对偶高效训练参数化演员策略。TS-DDR是一种自监督学习算法,使用随机梯度下降(SGD)训练通用决策规则(参数化策略);其前向传播求解确定性优化问题以找到可行策略,反向传播利用对偶理论以闭式梯度训练参数化策略。TS-DDR继承了深度学习方法的灵活性和计算性能来解决CMDP问题。应用于玻利维亚实际电力系统数据的长期水电调度(LTHD)问题,TS-DDR在解质量和计算时间上相比当前最先进方法提升了几个数量级。

关键词

引用

@article{arxiv.2405.14973,
  title  = {Efficiently Training Deep-Learning Parametric Policies using Lagrangian Duality},
  author = {Andrew Rosemberg and Alexandre Street and Davi M. Valladão and Pascal Van Hentenryck},
  journal= {arXiv preprint arXiv:2405.14973},
  year   = {2025}
}

备注

8 Main Pages, 8 Appendices, 7 Figures