LTL 代理奖励的动态规划收敛性保证
机器学习
2024-08-13 v1
摘要
线性时间逻辑 (LTL) 是用于模型化为马尔可夫决策过程 (MDP) 中的规划问题所需的复杂目标的形式化指定方法。规划问题旨在寻找最大化满足 LTL 目标概率的 optimal 策略。一种解决规划问题的方法是使用带有两个折扣因子的代理奖励和动态规划,绕过了传统模型检验中使用的图分析。代理奖励设计使得其价值函数代表满足概率。然而,在其中一个折扣因子设置为 以获得更高精度的情况下,使用动态规划计算价值函数无法得到保证。本工作证明,在动态规划更新期间,总会存在多步收缩,从而保证近似价值函数以指数收敛于真实价值函数。因此,满足概率的计算得到保证。
引用
@article{arxiv.2408.05437,
title = {Predicting Long-Term Allograft Survival in Liver Transplant Recipients},
author = {Xiang Gao and Michael Cooper and Maryam Naghibzadeh and Amirhossein Azhie and Mamatha Bhat and Rahul G. Krishnan},
journal= {arXiv preprint arXiv:2408.05437},
year = {2024}
}
备注
Accepted at MLHC 2024