基于惩罚方法的双层强化学习与 RLHF 原则方法
机器学习
2024-06-04 v3 最优化与控制
机器学习
摘要
双层优化最近被应用于许多机器学习任务。然而,其应用受限于监督学习设置,即考虑具有良好结构的静态目标函数。但诸如激励设计、逆强化学习(RL)和从人类反馈获取的强化学习(RLHF)等双层问题常被建模为超出简单静态目标结构的动态目标函数,这给现有双层解决方案带来了显著挑战。为解决这类新型双层问题,本文提出了通过惩罚公式视角解决双层强化学习问题的首个原则性算法框架。我们对问题景观及其惩罚基于(策略)梯度算法进行了理论研究。通过在Stackelberg马尔可夫游戏、从人类反馈获取强化学习和激励设计中的仿真实验,展示了我们算法的有效性。
引用
@article{arxiv.2402.06886,
title = {Principled Penalty-based Methods for Bilevel Reinforcement Learning and RLHF},
author = {Han Shen and Zhuoran Yang and Tianyi Chen},
journal= {arXiv preprint arXiv:2402.06886},
year = {2024}
}
备注
Shorter version accepted to ICML 2024