论分布鲁棒强化学习的理论基础
机器学习
2025-08-26 v4 系统与控制
系统与控制
最优化与控制
机器学习
摘要
受训练与部署间环境偏移下对鲁棒策略需求之驱动,我们为分布鲁棒强化学习(DRRL)的理论基础做出贡献。这是通过一个以鲁棒马尔可夫决策过程(RMDPs)为核心的综合建模框架实现的。该框架要求决策者在由对手策划的最坏情形分布偏移下选择最优策略。通过统一并扩展现有表述,我们严格构建了涵盖决策者与对手各类建模属性的 RMDPs。这些属性包括信息可用性结构——涵盖历史依赖、马尔可夫以及马尔可夫时间齐次动态——以及对手所引发偏移的约束,重点关注 SA- 与 S-矩形性(rectangularity)。在此 RMDP 框架内,我们研究了动态规划原理(DPP)存在或不存在的条件。从算法角度看,DPP 的存在具有重要意义,因为绝大多数现有的数据与计算高效的 DRRL 算法都依赖于 DPP。为探究其存在性,我们系统分析了控制器与对手属性的各种组合,基于统一方法给出精简证明。随后,我们针对完全一般 DPP 不成立的设定构造反例,并为 DPP 缺失的关键场景建立渐近最优的历史依赖策略。
引用
@article{arxiv.2311.09018,
title = {On the Foundation of Distributionally Robust Reinforcement Learning},
author = {Shengbo Wang and Nian Si and Jose Blanchet and Zhengyuan Zhou},
journal= {arXiv preprint arXiv:2311.09018},
year = {2025}
}