自触发马尔可夫决策过程
系统与控制
2021-02-18 v1 人工智能
机器学习
系统与控制
最优化与控制
摘要
在本文中,我们研究带有自触发策略的马尔可夫决策过程(MDPs),其中自触发控制的思想被推广到更一般的MDP模型。这一推广将自触发策略的应用拓宽到更广泛的系统。我们研究控制策略与触发策略的协同设计问题,以优化两个预先指定的代价准则。第一个代价准则通过将预先指定的更新惩罚纳入传统MDP代价准则来减少通信资源的使用。在此准则下,提出一种称为具有优化前瞻的DP方程的新型动态规划(DP)方程,以求解该准则下的自触发策略。第二种自触发策略是在仍保证预先指定次优性水平的同时最大化触发时间。我们为两种策略的计算与实现建立了理论基础。通过一个网格世界数值例子,我们说明了两种策略在减少资源消耗方面的有效性,并展示了资源消耗与系统性能之间的权衡。
引用
@article{arxiv.2102.08571,
title = {Self-Triggered Markov Decision Processes},
author = {Yunhan Huang and Quanyan Zhu},
journal= {arXiv preprint arXiv:2102.08571},
year = {2021}
}