中文

奖励足以应对凸 MDP

人工智能 2023-06-05 v4 机器学习 机器学习

摘要

最大化一个马尔可夫且平稳的累积奖励函数(即定义于状态-动作对且独立于时间)足以刻画马尔可夫决策过程(MDP)中的多种目标。然而,并非所有目标都能以此方式刻画。本文研究凸 MDP,其中目标表示为平稳分布的凸函数,并表明它们无法用平稳奖励函数表述。凸 MDP 将标准强化学习(RL)问题表述推广至一个更大的框架,该框架包含许多监督与无监督 RL 问题,例如学徒学习、约束 MDP 以及所谓的“纯探索”。我们的方法是通过 Fenchel 对偶性,将凸 MDP 问题重新表述为涉及策略与代价(负奖励)“参与者”的极小极大博弈。我们提出一种求解该问题的元算法,并表明它统一了文献中的许多现有算法。

关键词

引用

@article{arxiv.2106.00661,
  title  = {Reward is enough for convex MDPs},
  author = {Tom Zahavy and Brendan O'Donoghue and Guillaume Desjardins and Satinder Singh},
  journal= {arXiv preprint arXiv:2106.00661},
  year   = {2023}
}