用于完全可观测环境中决策的循环和-积-最大网络
人工智能
2020-06-15 v1 机器学习
摘要
近期对推广了和-积网络 (SPN) 的和-积-最大网络 (SPMN) 的研究,为长期以来主要依赖手工设计模型的决策问题提供了一种数据驱动的替代方案。SPMN 在计算上表示一个概率决策问题,其求解规模与网络大小呈线性关系。然而,SPMN 并不太适合跨多个时间步的顺序决策。在本文中,我们提出了循环 SPMN (RSPMN),它能够从随时间变化的决策数据中学习并对其进行建模。RSPMN 利用一个模板网络,该网络可根据数据序列的长度按需展开。这一点意义重大,因为 RSPMN 不仅继承了 SPMN 数据驱动和大部分可处理的优点,还非常适合顺序问题。我们建立了模板网络的条件,以保证生成的 SPMN 是有效的,并提出了一种结构学习算法来学习合理的模板网络。我们证明,在顺序决策数据集测试平台上学习到的 RSPMN,在完全可观测领域能够生成接近最优的最大期望效用 (MEU) 和策略。它们轻松超越了近期的一种批量约束强化学习方法,这一点很重要,因为 RSPMN 为离线强化学习提供了一种新的基于模型的方法。
引用
@article{arxiv.2006.07300,
title = {Recurrent Sum-Product-Max Networks for Decision Making in Perfectly-Observed Environments},
author = {Hari Teja Tatavarti and Prashant Doshi and Layton Hayes},
journal= {arXiv preprint arXiv:2006.07300},
year = {2020}
}