中文

无界单步成本 MDP 中的模型近似

最优化与控制 2024-02-15 v1 机器学习 系统与控制 系统与控制

摘要

我们考虑在只能访问一个近似模型 M^\hat{\mathcal{M}} 的情况下,为无限时域折扣成本马尔可夫决策过程 M\mathcal{M} 设计控制策略的问题。近似模型的最优策略 π^\hat{\pi}^{\star} 在原始模型 M\mathcal{M} 中使用时表现如何?我们通过界定 π^\hat{\pi}^\starM\mathcal{M} 中的价值函数与 M\mathcal{M} 的最优价值函数之差的加权范数来回答这个问题。然后,我们扩展了结果,通过考虑单步成本的仿射变换,获得了可能更紧的上界。我们进一步提供了明确依赖于原始模型和近似模型的成本函数之间的加权距离以及转移核之间的加权距离的上界。我们给出示例来说明我们的结果。

关键词

引用

@article{arxiv.2402.08813,
  title  = {Model approximation in MDPs with unbounded per-step cost},
  author = {Berk Bozkurt and Aditya Mahajan and Ashutosh Nayyar and Yi Ouyang},
  journal= {arXiv preprint arXiv:2402.08813},
  year   = {2024}
}