中文

DARLING:基于非平稳保证的检测增强强化学习

机器学习 2026-05-13 v2 机器学习

摘要

我们研究了在没有对非平稳性先验知识的情况下,针对有限时序无记忆马尔可夫决策过程(MDPs)的无模型强化学习(RL)。我们关注piecewise stationary(PS)设置,即奖励和转移动力学可以在未知时间发生变化。我们首先重访现有的SOTA方法,识别其理论和实际局限性,从而改变当前性能保证的格局。为刻画问题的难度,我们为PS-RL在表格型和线性MDPs中建立了首个下界。随后,我们引入检测增强强化学习(DARLING),这是一种可用于表格型和线性MDPs的模块化PS-RL包装器,无需知道变化的具体时间。在表格型MDPs中,在变点可分离性和可达性条件下,DARLING改进了现有最佳的动态 regret下界,并匹配了我们的下界。在线性MDPs中,DARLING在相关可达性参数已知时匹配下界,并我们的分析阐明了与表格型情况不同的结构性障碍。最后,通过在多样化的非平稳基准上的大量实验,我们表明DARLING持续超越当前的SOTA方法。

关键词

引用

@article{arxiv.2604.16684,
  title  = {DARLING: Detection Augmented Reinforcement Learning with Non-Stationary Guarantees},
  author = {Argyrios Gerogiannis and Yu-Han Huang and Venugopal V. Veeravalli},
  journal= {arXiv preprint arXiv:2604.16684},
  year   = {2026}
}

备注

50 pages, 8 figures