强化学习中分布鲁棒性的奇特代价:基于生成模型的情形
机器学习
2025-09-09 v3 信息论
math.IT
统计理论
统计理论
摘要
本文研究强化学习(RL)中的模型鲁棒性,以在实践中缩小仿真到现实的差距。我们采用分布鲁棒马尔可夫决策过程(RMDP)框架,旨在学习一种策略,在部署环境落入名义 MDP 周围规定不确定性集内时优化最坏情况性能。尽管近期已有研究,但无论使用何种不确定性集,RMDP 的样本复杂度大多尚未明确。尚不清楚当与标准 RL 对比时,分布鲁棒性是否带来任何统计后果。假设可访问基于名义 MDP 抽取样本的生成模型,我们针对通过总变差(TV)距离或卡方散度指定的不确定性集,给出了 RMDP 样本复杂度的近最优刻画。此处研究的算法为一种称为分布鲁棒值迭代的基于模型的方法,其对全范围不确定性水平均被证明是近最优的。有些令人惊讶的是,我们的结果揭示 RMDP 未必比标准 MDP 更易或更难学习。鲁棒性要求带来的统计后果严重依赖于不确定性集的大小与形状:在 TV 距离情形下,RMDP 的极小极大样本复杂度始终小于标准 MDP;在卡方散度情形下,RMDP 的样本复杂度远超标准 MDP 对应值。
引用
@article{arxiv.2305.16589,
title = {The Curious Price of Distributional Robustness in Reinforcement Learning with a Generative Model},
author = {Laixi Shi and Gen Li and Yuting Wei and Yuxin Chen and Matthieu Geist and Yuejie Chi},
journal= {arXiv preprint arXiv:2305.16589},
year = {2025}
}
备注
A short version was published in Neural Information Processing Systems (2023); Under Submission