中文

松弛但保持控制:从值到在线马尔可夫决策过程的算法

机器学习 2015-09-01 v2 最优化与控制 机器学习

摘要

在线学习算法旨在非平稳环境中运行,但通常缺乏动态状态的概念来将当前和未来的行动约束建模为过去行动的函数。基于状态的模型在随机控制设置中很常见,但常用的框架(如马尔可夫决策过程,MDPs)假设环境是已知且平稳的。近年来,人们越来越有兴趣结合上述两种框架,考虑一种成本函数允许在每一步后任意变化的 MDP 设置。然而,该领域的大多数工作都是算法层面的:针对给定问题,几乎需要从头开发算法。此外,状态的存在和对任意变化环境的假设使理论分析和计算高效方法的开发都变得复杂。本文描述了由 Rakhlin 等人提出的思想的广泛扩展,以提供一个在成本任意变化的 MDP 设置中推导算法的通用框架。该框架导致了对现有方法的统一观点,并提供了构建新方法的通用过程。我们提出了几种新方法,其中一种被证明比通过近似动态规划的在线版本从头开发的类似方法具有重要优势。

关键词

引用

@article{arxiv.1310.7300,
  title  = {Relax but stay in control: from value to algorithms for online Markov decision processes},
  author = {Peng Guan and Maxim Raginsky and Rebecca Willett},
  journal= {arXiv preprint arXiv:1310.7300},
  year   = {2015}
}

备注

40 pages; additional results in the convex-analytic framework