中文

约束 MDP 中的探索与利用

机器学习 2020-03-05 v1 机器学习

摘要

在许多序贯决策问题中,目标是在满足一组关于不同效用的约束的同时优化某个效用函数。这一学习问题通过约束马尔可夫决策过程(CMDPs)被形式化。在本文中,我们研究 CMDPs 中的探索-利用困境。在未知 CMDP 中学习时,智能体应权衡探索(以发现关于 MDP 的新信息)与利用(利用当前知识在满足约束的同时最大化奖励)。虽然智能体最终会学到良好或最优策略,我们不希望其在学习过程中过于频繁地违反约束。在这项工作中,我们分析两种在 CMDPs 中学习的方法。第一种方法利用 CMDP 的线性公式在每一幕进行乐观规划。第二种方法利用 CMDP 的对偶公式(或鞍点公式)对原始与对偶变量进行增量式乐观更新。我们表明两者相对于主效用均获得次线性后悔,同时在约束违反上亦具有次线性后悔。尽管如此,我们强调两种方法之间的一个关键差异:线性规划方法比基于对偶公式的方法给出更强的保证。

关键词

引用

@article{arxiv.2003.02189,
  title  = {Exploration-Exploitation in Constrained MDPs},
  author = {Yonathan Efroni and Shie Mannor and Matteo Pirotta},
  journal= {arXiv preprint arXiv:2003.02189},
  year   = {2020}
}