奖励足以应对凸 MDP
人工智能
2023-06-05 v4 机器学习
机器学习
摘要
最大化一个马尔可夫且平稳的累积奖励函数(即定义于状态-动作对且独立于时间)足以刻画马尔可夫决策过程(MDP)中的多种目标。然而,并非所有目标都能以此方式刻画。本文研究凸 MDP,其中目标表示为平稳分布的凸函数,并表明它们无法用平稳奖励函数表述。凸 MDP 将标准强化学习(RL)问题表述推广至一个更大的框架,该框架包含许多监督与无监督 RL 问题,例如学徒学习、约束 MDP 以及所谓的“纯探索”。我们的方法是通过 Fenchel 对偶性,将凸 MDP 问题重新表述为涉及策略与代价(负奖励)“参与者”的极小极大博弈。我们提出一种求解该问题的元算法,并表明它统一了文献中的许多现有算法。
引用
@article{arxiv.2106.00661,
title = {Reward is enough for convex MDPs},
author = {Tom Zahavy and Brendan O'Donoghue and Guillaume Desjardins and Satinder Singh},
journal= {arXiv preprint arXiv:2106.00661},
year = {2023}
}