面向激励对齐的上下文双层强化学习
最优化与控制
2024-12-10 v2 人工智能
机器学习
机器学习
摘要
各种现实世界战略决策问题中的最优策略既取决于环境配置,也取决于外生事件。针对这些场景,我们引入了上下文双层强化学习(CB-RL),一种随机双层决策模型,其中下层包括求解一个上下文马尔可夫决策过程(CMDP)。CB-RL可以看作一个Stackelberg博弈,其中领导者以及领导者无法控制的随机上下文共同决定了多个MDP的设置,而潜在的多个追随者对这些MDP做出最佳响应。该框架超越了传统的双层优化,并在RLHF、税收设计、奖励塑造、契约理论和机制设计等多个领域具有相关性。我们提出了一种随机超策略梯度下降(HPGD)算法来求解CB-RL,并证明了其收敛性。值得注意的是,HPGD基于对追随者轨迹的观察使用随机超梯度估计。因此,它允许追随者使用任何训练程序,并且领导者可以不知道具体算法,这与各种现实场景相符。我们进一步考虑了领导者可以影响追随者训练的场景,并提出了一种加速算法。我们通过实验证明了我们的算法在奖励塑造和税收设计方面的性能。
引用
@article{arxiv.2406.01575,
title = {Contextual Bilevel Reinforcement Learning for Incentive Alignment},
author = {Vinzenz Thoma and Barna Pasztor and Andreas Krause and Giorgia Ramponi and Yifan Hu},
journal= {arXiv preprint arXiv:2406.01575},
year = {2024}
}
备注
60 pages, 21 Figures