挑战凸强化学习中的常见假设
机器学习
2023-01-30 v3
摘要
经典的强化学习(RL)公式关注于标量奖励函数的最大化。近年来,凸强化学习被引入,将RL公式扩展到由策略诱导的状态分布的所有凸函数目标。值得注意的是,凸RL涵盖了若干不属于标量公式的相关应用,包括模仿学习、风险厌恶RL和纯探索。在经典RL中,通常优化无限试验目标,该目标考虑状态分布而非经验状态访问频率,尽管实际轨迹数量在实践中总是有限的。这在理论上是合理的,因为无限试验与有限试验目标可被证明是一致的,从而导致相同的最优策略。在本文中,我们表明这一隐含假设在凸RL设定中不成立。具体而言,我们表明错误地用无限试验目标替代实际的有限试验目标进行优化(如通常所做的那样)会导致显著的近似误差。由于有限试验设定在模拟和真实世界RL中均为默认,我们相信阐明此问题将带来更好的凸RL方法与方法论,影响模仿学习、风险厌恶RL和纯探索等相关研究领域。
引用
@article{arxiv.2202.01511,
title = {Challenging Common Assumptions in Convex Reinforcement Learning},
author = {Mirco Mutti and Riccardo De Santi and Piersilvio De Bartolomeis and Marcello Restelli},
journal= {arXiv preprint arXiv:2202.01511},
year = {2023}
}
备注
NeurIPS 2022