中文

分布式鲁棒平均奖励强化学习的样本复杂度

机器学习 2026-02-03 v3 最优化与控制 机器学习

摘要

我们受实际应用启发,这些应用中稳定的长期性能至关重要——例如机器人、运营研究和医疗保健——我们研究了分布式鲁棒(DR)平均奖励强化学习的问题。我们提出了两种算法,实现了接近最优的样本复杂度。第一个算法将问题简化为 DR 折扣马尔可夫决策过程(MDP),而第二个算法——锚定 DR 平均奖励 MDP——引入锚定状态以稳定不确定性集合中的受控转移核。假设名义 MDP 是均匀 Ergodic,我们证明两种算法在 KL 和 fkf_k-divergence 基于不确定性集合的情形下,均可实现样本复杂度为 O~(SAtmix2ε2)\widetilde{O}\left(|\mathbf{S}||\mathbf{A}| t_{\mathrm{mix}}^2\varepsilon^{-2}\right) 以估计最优策略以及鲁棒平均奖励,其中 ε\varepsilon 为目标精度,S|\mathbf{S}|A|\mathbf{A}| 分别为状态和动作空间的大小,tmixt_{\mathrm{mix}} 为名义 MDP 的混合时间。这代表了 DR 平均奖励强化学习的第一个有限样本收敛保证。我们进一步通过数值实验验证了我们算法的收敛率。

关键词

引用

@article{arxiv.2505.10007,
  title  = {Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning},
  author = {Zijun Chen and Shengbo Wang and Nian Si},
  journal= {arXiv preprint arXiv:2505.10007},
  year   = {2026}
}

备注

Accepted at NeurIPS 2025. Updated with minor corrections and additional experiments