受约束双层强化学习的样本复杂度分析
机器学习
2026-02-03 v1 人工智能
摘要
强化学习 (RL) 文献中Several important problem settings(如元学习、层次学习和来自人类反馈的 RL (RL-HF))可建模为双层 RL 问题。尽管在这些领域取得了显著的经验成果,但双层 RL 算法的理论分析仍受到忽视。在本工作中,我们分析了受约束双层 RL 算法的样本复杂度,延续了在无约束情境下的进展。我们获得的迭代复杂度为 ,样本复杂度为 ,用于我们提出的受约束双层次梯度优化 (Constrained Bilevel Subgradient Optimization, CBSO) 算法。我们采用惩罚-based 目标函数以避免双层问题情境下的原始-对偶差距和超梯度问题。处理约束的惩罚-based 形式需要对非光滑优化进行分析。我们是首次对一般参数化策略梯度-based RL 算法中带非光滑目标函数的情况进行分析,运用了 Moreau 包络。
引用
@article{arxiv.2602.00282,
title = {Sample Complexity Analysis for Constrained Bilevel Reinforcement Learning},
author = {Naman Saxena and Vaneet Aggarwal},
journal= {arXiv preprint arXiv:2602.00282},
year = {2026}
}