中文

受约束双层强化学习的样本复杂度分析

机器学习 2026-02-03 v1 人工智能

摘要

强化学习 (RL) 文献中Several important problem settings(如元学习、层次学习和来自人类反馈的 RL (RL-HF))可建模为双层 RL 问题。尽管在这些领域取得了显著的经验成果,但双层 RL 算法的理论分析仍受到忽视。在本工作中,我们分析了受约束双层 RL 算法的样本复杂度,延续了在无约束情境下的进展。我们获得的迭代复杂度为 O(ϵ2)O(\epsilon^{-2}),样本复杂度为 O~(ϵ4)\tilde{O}(\epsilon^{-4}),用于我们提出的受约束双层次梯度优化 (Constrained Bilevel Subgradient Optimization, CBSO) 算法。我们采用惩罚-based 目标函数以避免双层问题情境下的原始-对偶差距和超梯度问题。处理约束的惩罚-based 形式需要对非光滑优化进行分析。我们是首次对一般参数化策略梯度-based RL 算法中带非光滑目标函数的情况进行分析,运用了 Moreau 包络。

关键词

引用

@article{arxiv.2602.00282,
  title  = {Sample Complexity Analysis for Constrained Bilevel Reinforcement Learning},
  author = {Naman Saxena and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2602.00282},
  year   = {2026}
}