面向计算受限决策问题的层次化状态抽象
人工智能
2021-02-23 v1 机器学习
摘要
在这篇半教程性质的论文中,我们首先回顾了用于解释序贯决策问题中最优动作搜索过程中所产生计算成本的信息论方法。传统的马尔可夫决策过程(MDP)框架在搜索最优策略时忽略了计算局限性,本质上假设智能体是完全理性的并追求精确最优。通过引入自由能,我们提出了一种变分原理,它不仅考虑策略本身的价值,还考虑了找到该最优策略的成本。由此公式导出的变分方程的解,可以通过动态规划(DP)中熟悉的类贝尔曼值迭代和率失真理论中的 Blahut-Arimoto(BA)算法获得。最后,我们展示了该方法在生成层次化状态抽象方面的实用性,这些抽象可用于最佳地利用可用的计算资源。一个数值示例在网格世界环境中的路径规划问题上展示了这些概念。
引用
@article{arxiv.1710.07990,
title = {Hierarchical State Abstractions for Decision-Making Problems with Computational Constraints},
author = {Daniel T. Larsson and Daniel Braun and Panagiotis Tsiotras},
journal= {arXiv preprint arXiv:1710.07990},
year = {2021}
}