随机最短路径马尔可夫决策过程作为概率推断的求解
机器学习
2021-09-14 v1 人工智能
摘要
先前关于将规划作为主动推断的工作处理的是有限时域问题以及适用于在线规划的解决方案。我们提出将一般的随机最短路径马尔可夫决策过程(SSP MDP)作为概率推断来求解。此外,我们讨论在不确定性下进行规划的在线与离线方法。在 SSP MDP 中,时域是不确定的且先验未知。SSP MDP 推广了有限和无限时域 MDP,并被人工智能界广泛使用。另外,我们强调了使用人工智能界广泛采用的动态规划方法与主动推断界所用方法求解 MDP 的一些差异。
引用
@article{arxiv.2109.05866,
title = {On Solving a Stochastic Shortest-Path Markov Decision Process as Probabilistic Inference},
author = {Mohamed Baioumy and Bruno Lacerda and Paul Duckworth and Nick Hawes},
journal= {arXiv preprint arXiv:2109.05866},
year = {2021}
}
备注
Presented at the second International Workshop on Active Inference (IWAI 2021); 11 pages, 2 figures