中文

基于散度的 S-矩形分布式鲁棒强化学习的最优样本复杂度

机器学习 2026-04-29 v3 机器学习

摘要

分布式鲁棒强化学习 (DR-RL) 近年来因其作为原则性方法以解决训练与测试环境之间差异的做法而受到广泛关注。为平衡鲁棒性、保守性与计算可追溯性,文献中提出了具有 SA-矩形和 S-矩形对手模型。虽然大多数现有统计分析聚焦于 SA-矩形模型,主要due to其算法简单性以及确定性策略的最优性,但 S-矩形模型更准确地捕捉实际应用中分布差异,往往产生更有效的鲁棒随机策略。本文研究针对基于散度的 S-矩形 DR-RL 的经验值迭代算法,建立了 O~(SA(1γ)4ε2)\widetilde{O}(|\mathcal{S}||\mathcal{A}|(1-\gamma)^{-4}\varepsilon^{-2}) 的近最优样本复杂度,其中 ε\varepsilon 为目标精度,S|\mathcal{S}|A|\mathcal{A}| 分别为状态空间和动作空间的基数,γ\gamma 为折扣因子。我们在已知的文献中,这些是首个实现对 S|\mathcal{S}|A|\mathcal{A}|ε\varepsilon 同时具有最优依赖关系的基于散度的 S-矩形模型样本复杂度结果。我们进一步通过在鲁棒库存控制问题和理论最坏情况示例中的数值实验验证了这些理论依赖关系,展示了所提出算法的快速学习性能。

关键词

引用

@article{arxiv.2505.12202,
  title  = {Near-Optimal Sample Complexities of Divergence-based S-rectangular Distributionally Robust Reinforcement Learning},
  author = {Zhenghao Li and Shengbo Wang and Nian Si},
  journal= {arXiv preprint arXiv:2505.12202},
  year   = {2026}
}