分布式鲁棒平均奖励强化学习的样本复杂度
机器学习
2026-02-03 v3 最优化与控制
机器学习
摘要
我们受实际应用启发,这些应用中稳定的长期性能至关重要——例如机器人、运营研究和医疗保健——我们研究了分布式鲁棒(DR)平均奖励强化学习的问题。我们提出了两种算法,实现了接近最优的样本复杂度。第一个算法将问题简化为 DR 折扣马尔可夫决策过程(MDP),而第二个算法——锚定 DR 平均奖励 MDP——引入锚定状态以稳定不确定性集合中的受控转移核。假设名义 MDP 是均匀 Ergodic,我们证明两种算法在 KL 和 -divergence 基于不确定性集合的情形下,均可实现样本复杂度为 以估计最优策略以及鲁棒平均奖励,其中 为目标精度, 和 分别为状态和动作空间的大小, 为名义 MDP 的混合时间。这代表了 DR 平均奖励强化学习的第一个有限样本收敛保证。我们进一步通过数值实验验证了我们算法的收敛率。
引用
@article{arxiv.2505.10007,
title = {Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning},
author = {Zijun Chen and Shengbo Wang and Nian Si},
journal= {arXiv preprint arXiv:2505.10007},
year = {2026}
}
备注
Accepted at NeurIPS 2025. Updated with minor corrections and additional experiments