中文

神经渐进对冲:用随机规划在强化学习中强制约束

机器学习 2022-03-01 v1 人工智能

摘要

我们提出一种称为神经渐进对冲(NP)的框架,在强化学习(RL)策略执行的在线阶段利用随机规划。目标是在策略执行期间,利用状态转移的概率模型引导策略调整,以确保关于约束和基于风险的目标(如条件风险价值(CVaR))的可行性。该框架特别适用于序列资源分配问题类,因为典型的资源约束可行性无法以可扩展的方式强制实施。NP 框架提供了一种替代方案,在在线阶段仅增加适度开销。实验结果证明了 NP 框架在两个连续真实世界任务上的有效性:(i) 具流动性约束、以非平稳状态分布为特征的金融规划投资组合优化问题;(ii) 共享单车系统中的动态调度问题,体现供需匹配问题类。我们表明 NP 框架生成的策略优于深度 RL 与其他基线方法,能适应非平稳性,同时满足结构约束并在所得策略中容纳风险度量。NP 框架的额外优势是易于实现和策略更好的可解释性。

关键词

引用

@article{arxiv.2202.13436,
  title  = {Neural-Progressive Hedging: Enforcing Constraints in Reinforcement Learning with Stochastic Programming},
  author = {Supriyo Ghosh and Laura Wynter and Shiau Hong Lim and Duc Thien Nguyen},
  journal= {arXiv preprint arXiv:2202.13436},
  year   = {2022}
}