中文

通过更紧的成本乐观性与奖励保守性提高安全强化学习的懊悔上界

机器学习 2024-10-15 v1 最优化与控制

摘要

本文研究了以有限时段 Tabular 有限马尔可夫决策过程为形式的安全强化学习问题,其中转换核不知、奖励和成本函数为随机函数。我们提出一种基于新颖成本和奖励函数估计算法,该算法提供更紧的成本乐观性和奖励保守性。虽然保证每个回合内不违反约束,但我们的算法实现了懊悔上界为 O~((CˉCˉb)1H2.5SAK)\widetilde{\mathcal{O}}((\bar C - \bar C_b)^{-1}H^{2.5} S\sqrt{AK}),其中 Cˉ\bar C 为每个回合的成本预算,Cˉb\bar C_b 为安全基线策略在回合内的预期成本,HH 为时域,SSAAKK 分别为状态数、动作数和回合数。该结果改进了已知最好的懊悔上界;当 CˉCˉb=Ω(H)\bar C- \bar C_b=\Omega(H) 时,几乎匹配懊悔下界 Ω(H1.5SAK)\Omega(H^{1.5}\sqrt{SAK})。我们通过贝尔曼类型总方差定律推导我们的成本和奖励函数估计器,以获得价值函数估计和的紧密方差和的上界。这导致函数估计器对时域的更紧密依赖。我们还提出了数值结果,表明我们提出的框架在计算方面具有有效性。

关键词

引用

@article{arxiv.2410.10158,
  title  = {Improved Regret Bound for Safe Reinforcement Learning via Tighter Cost Pessimism and Reward Optimism},
  author = {Kihyun Yu and Duksang Lee and William Overman and Dabeen Lee},
  journal= {arXiv preprint arXiv:2410.10158},
  year   = {2024}
}