非平稳风险敏感强化学习:近最优动态后悔、自适应检测与分离设计
机器学习
2022-11-22 v1 最优化与控制
摘要
我们研究基于熵风险度量的风险敏感强化学习(RL),其环境为片段式非平稳马尔可夫决策过程(MDP)。奖励函数与状态转移核均未知,且允许随时间任意变化,其累积变化量受预算约束。当该变化预算先验已知时,我们提出两种基于重启的算法,即Restart-RSMB与Restart-RSQ,并建立了它们的动态后悔界。基于这些结果,我们进一步给出一种元算法,其不需要变化预算的任何先验知识,并能自适应检测指数值函数上的非平稳性。随后建立了非平稳风险敏感RL的动态后悔下界,以证明所提算法的近最优性。我们的结果还表明,若变化预算先验已知,风险管控与非平稳处理可在算法中分离设计,而自适应算法中的非平稳检测机制依赖于风险参数。本工作提供了文献中针对非平稳风险敏感RL的首个非渐近理论分析。
引用
@article{arxiv.2211.10815,
title = {Non-stationary Risk-sensitive Reinforcement Learning: Near-optimal Dynamic Regret, Adaptive Detection, and Separation Design},
author = {Yuhao Ding and Ming Jin and Javad Lavaei},
journal= {arXiv preprint arXiv:2211.10815},
year = {2022}
}
备注
33 pages,3 figures, AAAI 2023. arXiv admin note: text overlap with arXiv:2111.03947, arXiv:2102.05406 by other authors