中文

带Kullback-Leibler代价的动作约束马尔可夫决策过程

最优化与控制 2018-07-27 v1

摘要

本文关注于计算最优策略,其中单步奖励函数包含一个对名义动力学建模Kullback-Leibler散度的代价项。该技术由Todorov于2007年提出,其在一般条件下表明平均奖励最优方程的解可化为一个简单的特征向量问题。此后许多作者试图将该技术应用于控制问题及经济学中的有限理性模型。一个关键假设是输入过程基本无约束。例如,若名义动力学包含来自自然的随机性(如风对运动车辆的影响),则最优控制解并不尊重此外生扰动的性质。本文提出一种技术以求解更一般类别的动作约束MDP。主要思想是求解一整族参数化的MDP,其中参数为对单步奖励函数加权的标量。该方法新颖且实用,即便在原始无约束表述下亦如此。

关键词

引用

@article{arxiv.1807.10244,
  title  = {Action-Constrained Markov Decision Processes With Kullback-Leibler Cost},
  author = {Ana Bušić and Sean Meyn},
  journal= {arXiv preprint arXiv:1807.10244},
  year   = {2018}
}