通过更紧的成本乐观性与奖励保守性提高安全强化学习的懊悔上界
机器学习
2024-10-15 v1 最优化与控制
摘要
本文研究了以有限时段 Tabular 有限马尔可夫决策过程为形式的安全强化学习问题,其中转换核不知、奖励和成本函数为随机函数。我们提出一种基于新颖成本和奖励函数估计算法,该算法提供更紧的成本乐观性和奖励保守性。虽然保证每个回合内不违反约束,但我们的算法实现了懊悔上界为 ,其中 为每个回合的成本预算, 为安全基线策略在回合内的预期成本, 为时域,、 和 分别为状态数、动作数和回合数。该结果改进了已知最好的懊悔上界;当 时,几乎匹配懊悔下界 。我们通过贝尔曼类型总方差定律推导我们的成本和奖励函数估计器,以获得价值函数估计和的紧密方差和的上界。这导致函数估计器对时域的更紧密依赖。我们还提出了数值结果,表明我们提出的框架在计算方面具有有效性。
关键词
引用
@article{arxiv.2410.10158,
title = {Improved Regret Bound for Safe Reinforcement Learning via Tighter Cost Pessimism and Reward Optimism},
author = {Kihyun Yu and Duksang Lee and William Overman and Dabeen Lee},
journal= {arXiv preprint arXiv:2410.10158},
year = {2024}
}