中文

面向受损情形的表现性强化学习

机器学习 2025-05-12 v1

摘要

在表现性强化学习(RL)中,智能体面临的是与策略相关的环境:奖励和转移函数取决于智能体的策略。先前的表现性RL工作研究了重复再训练方法在表现稳定策略上的收敛。在有限样本 regime 下,这些方法反复求解一个凸凹目标的鞍点,该目标估计了正则化版本的强化学习问题的拉格朗日乘子。在本文中,我们旨在扩展这些重复再训练方法,使其能够在受损数据下运行。更具体地,我们考虑Huber的ϵ\epsilon-污染模型,其中ϵ\epsilon比例的数据点被任意对抗性噪声损坏。我们提出一种基于受损梯度的凸凹优化的重复再训练方法,以及一种用于梯度的特定问题的鲁棒均值估计器。我们证明,我们的方法对approximately稳定策略具有最后迭代收敛,近似误差与ϵ\sqrt{\epsilon}成线性关系。我们在实验中展示了在表现性RL中考虑损坏的重要性。

关键词

引用

@article{arxiv.2505.05609,
  title  = {On Corruption-Robustness in Performative Reinforcement Learning},
  author = {Vasilis Pollatos and Debmalya Mandal and Goran Radanovic},
  journal= {arXiv preprint arXiv:2505.05609},
  year   = {2025}
}