中文

带有生成模型的迭代 CVaR 强化学习的近最优样本复杂度

机器学习 2025-03-25 v3

摘要

在本工作中,我们研究了带有生成模型的风险敏感强化学习(RL)的样本复杂度问题,旨在在每个步骤中最大化风险容忍水平为 τ\tau 的条件风险价值(CVaR),我们将此准则称为 Iterated CVaR。我们首先在 Iterated CVaR RL 与具有特定 CVaR 不确定性集的 (s,a)(s, a)-矩形分布鲁棒 RL 之间建立了联系。我们确立了该问题样本复杂度的近乎匹配的上下界。具体而言,我们首先证明了一种基于值迭代的算法 ICVaR-VI 最多使用 O~(SA(1γ)4τ2ϵ2)\tilde{O} \left(\frac{SA}{(1-\gamma)^4\tau^2\epsilon^2} \right) 个样本即可实现 ϵ\epsilon-最优策略,其中 γ\gamma 是折扣因子,S,AS, A 分别是状态空间和动作空间的大小。此外,当 τγ\tau \geq \gamma 时,样本复杂度可改善至 O~(SA(1γ)3ϵ2)\tilde{O} \left( \frac{SA}{(1-\gamma)^3\epsilon^2} \right)。我们进一步给出了 O~((1γτ)SA(1γ)4τϵ2)\tilde{O} \left(\frac{(1-\gamma \tau)SA}{(1-\gamma)^4\tau\epsilon^2} \right) 的极小化极大下界。对于固定的风险水平 τ(0,1]\tau \in (0,1],我们的上下界相匹配,证明了我们分析的紧致性与最优性。我们还研究了风险水平 τ\tau 较小的极限情况,称为 Worst-Path RL,其目标是最大化最小可能累积奖励。我们开发了匹配的上下界 O~(SApmin)\tilde{O} \left(\frac{SA}{p_{\min}} \right),其中 pminp_{\min} 表示转移核的最小非零到达概率。

关键词

引用

@article{arxiv.2503.08934,
  title  = {Near-Optimal Sample Complexity for Iterated CVaR Reinforcement Learning with a Generative Model},
  author = {Zilong Deng and Simon Khan and Shaofeng Zou},
  journal= {arXiv preprint arXiv:2503.08934},
  year   = {2025}
}

备注

Accepted as a conference paper at AISTATS 2025