长期平均奖励与总奖励的多目标优化
计算机科学中的逻辑
2021-01-08 v2
摘要
本文提出了一种高效的过程,用于长期平均奖励(又称:平均收益)与总奖励目标及其组合的多目标模型检测。我们考虑马尔可夫自动机这一组合模型,它同时涵盖传统的马尔可夫决策过程(MDP)及其连续时间变体。我们过程的关键在于将 Forejt 等人针对 MDP 上总奖励的方法推广到马尔可夫自动机上长期与总奖励目标的任意组合。基于 Storm 模型检测器的原型实现实验显示,对两类模型均取得令人鼓舞的结果,并表明相较基于线性规划的现有多目标长期 MDP 模型检测,性能有显著提升。
引用
@article{arxiv.2010.13566,
title = {Multi-objective Optimization of Long-run Average and Total Rewards},
author = {Tim Quatmann and Joost-Pieter Katoen},
journal= {arXiv preprint arXiv:2010.13566},
year = {2021}
}