带有生成模型的迭代 CVaR 强化学习的近最优样本复杂度
机器学习
2025-03-25 v3
摘要
在本工作中,我们研究了带有生成模型的风险敏感强化学习(RL)的样本复杂度问题,旨在在每个步骤中最大化风险容忍水平为 的条件风险价值(CVaR),我们将此准则称为 Iterated CVaR。我们首先在 Iterated CVaR RL 与具有特定 CVaR 不确定性集的 -矩形分布鲁棒 RL 之间建立了联系。我们确立了该问题样本复杂度的近乎匹配的上下界。具体而言,我们首先证明了一种基于值迭代的算法 ICVaR-VI 最多使用 个样本即可实现 -最优策略,其中 是折扣因子, 分别是状态空间和动作空间的大小。此外,当 时,样本复杂度可改善至 。我们进一步给出了 的极小化极大下界。对于固定的风险水平 ,我们的上下界相匹配,证明了我们分析的紧致性与最优性。我们还研究了风险水平 较小的极限情况,称为 Worst-Path RL,其目标是最大化最小可能累积奖励。我们开发了匹配的上下界 ,其中 表示转移核的最小非零到达概率。
引用
@article{arxiv.2503.08934,
title = {Near-Optimal Sample Complexity for Iterated CVaR Reinforcement Learning with a Generative Model},
author = {Zilong Deng and Simon Khan and Shaofeng Zou},
journal= {arXiv preprint arXiv:2503.08934},
year = {2025}
}
备注
Accepted as a conference paper at AISTATS 2025