中文

上下文马尔可夫决策过程

机器学习 2015-02-10 v1 机器学习

摘要

我们考虑一类规划问题,其中环境的动态与奖励依赖于一个称为上下文(context)的隐藏静态参数。目标是学习一种策略,最大化跨所有上下文的累积奖励。这一称为上下文马尔可夫决策过程(CMDP)的新模型能够建模客户与网站(学习者)交互时的行为。客户行为取决于性别、年龄、位置、设备等等。基于该行为,网站的目标是确定客户特征并优化二者间的交互。我们的工作聚焦于一个基本场景——具有少量已知可能上下文的有限视野(finite horizon)。我们提出一族带有可证明保证的算法,可学习底层模型与潜在上下文,并优化 CMDP。针对特定的朴素实现给出了边界,并讨论了框架的扩展,为未来研究奠定基础。

关键词

引用

@article{arxiv.1502.02259,
  title  = {Contextual Markov Decision Processes},
  author = {Assaf Hallak and Dotan Di Castro and Shie Mannor},
  journal= {arXiv preprint arXiv:1502.02259},
  year   = {2015}
}