具有 Kullback-Leibler 控制代价的在线 Markov 决策过程
最优化与控制
2014-01-15 v1 机器学习
系统与控制
摘要
本文考虑一个在线(实时)控制问题,涉及一个智能体在有限状态空间上进行离散时间随机游走。智能体在每个时间步的动作是指定给定当前状态时下一状态的概率分布。遵循 Todorov 的设定,每个时间步的状态-动作代价是状态代价与控制代价之和,其中控制代价由智能体的下一状态分布与由某个固定被动动力学确定的分布之间的 Kullback-Leibler(KL)散度给出。该问题的在线特性源于状态代价函数由动态环境生成,且智能体仅在选择动作后才能获知当前状态代价。在温和的正则性条件下,我们给出了一个具有小遗憾(即其期望实际总代价与利用状态代价的非因果知识可达到的最小代价之差)的计算高效策略的显式构造,并展示了所提策略在模拟目标跟踪问题上的性能。此外,还获得了关于具有 KL 控制代价的 Markov 决策过程的若干新结果。
引用
@article{arxiv.1401.3198,
title = {Online Markov decision processes with Kullback-Leibler control cost},
author = {Peng Guan and Maxim Raginsky and Rebecca Willett},
journal= {arXiv preprint arXiv:1401.3198},
year = {2014}
}
备注
to appear in IEEE Transactions on Automatic Control