中文

e-COP:基于剧情的受约束策略优化

机器学习 2024-12-19 v2

摘要

本文提出了 e-COP\texttt{e-COP} 算法,是首个针对受约束强化学习(RL)的episodic(有限时限)情景下的策略优化算法。此类表述适用于系统行为存在独立的优化准则和约束条件的情况。我们通过首先建立episodic setting下的策略差分引理,提供该算法的理论基础。随后,我们提出将既有方法与新方法结合,构建 e-COP\texttt{e-COP} 算法,该算法易于实现且数值稳定,并在特定比例假设下提供最优性保证。通过在 Safety Gym 测试套件中的广泛实证分析,我们显示该算法在类似或优于适用于episodic setting的 SOTA(非episodic)算法方面表现良好。该算法的可扩展性为其在大型语言或扩散模型中受人类反馈的受约束强化学习应用开辟了道路。

关键词

引用

@article{arxiv.2406.09563,
  title  = {e-COP : Episodic Constrained Optimization of Policies},
  author = {Akhil Agnihotri and Rahul Jain and Deepak Ramachandran and Sahil Singla},
  journal= {arXiv preprint arXiv:2406.09563},
  year   = {2024}
}