带策略先验的随时竞争强化学习
机器学习
2024-02-06 v3
摘要
本文研究随时竞争马尔可夫决策过程(A-CMDP)问题。现有关于约束马尔可夫决策过程(CMDPs)的工作旨在优化期望奖励,同时约束随机动态下的期望代价,但特定回合中的代价仍可能高得不可接受。相比之下,A-CMDP 的目标是在与策略先验对抗的每一回合中保证有界代价的同时优化期望奖励。我们提出一种称为随时竞争强化学习(ACRL)的新算法,可证明地保证随时代价约束。遗憾分析表明,该策略渐近地匹配在随时竞争约束下可达成的最优奖励。在碳智能计算应用上的实验验证了 ACRL 的奖励性能与代价约束保证。
引用
@article{arxiv.2311.01568,
title = {Anytime-Competitive Reinforcement Learning with Policy Prior},
author = {Jianyi Yang and Pengfei Li and Tongxin Li and Adam Wierman and Shaolei Ren},
journal= {arXiv preprint arXiv:2311.01568},
year = {2024}
}
备注
Accepted by NeurIPS 2023