基于卡方检验的分解式 MDP 结构学习方法
机器学习
2012-07-02 v1 人工智能
机器学习
摘要
SDYNA 是一个旨在解决大规模随机强化学习问题的通用框架。与 FMDP 中先前基于模型的方法不同,它使用监督学习技术增量地学习强化学习问题的结构和参数。然后,它集成基于 FMDP 的决策规划算法来计算其策略。SPITI 是 SDYNA 的一个实例化,它利用 ITI(一种增量决策树算法)来学习奖励函数以及带有局部结构的动态贝叶斯网络,用以表示问题的转移函数。这些表示被增量版本的 Structured Value Iteration 算法所使用。为了学习结构,SPITI 使用卡方检验来检测两个概率分布之间的独立性。因此,我们研究了卡方检验中使用的阈值与所构建模型的大小以及诱导策略的价值函数相对于最优值的相对误差之间的关系。我们表明,在随机问题上,可以调整阈值以生成紧凑的模型和高效的策略。然后,我们表明,SPITI 在保持模型紧凑的同时,利用其学习方法的泛化特性,在结构未知的大规模强化学习问题中表现优于经典的随机表格算法。我们还引入了一种基于卡方的新度量,用以评估 SPITI 所学模型的准确性。我们定性地表明,FMDP 框架内 SPITI 的泛化特性可以防止大规模随机强化学习问题结构学习所需时间的指数级增长。
引用
@article{arxiv.1206.6842,
title = {Chi-square Tests Driven Method for Learning the Structure of Factored MDPs},
author = {Thomas Degris and Olivier Sigaud and Pierre-Henri Wuillemin},
journal= {arXiv preprint arXiv:1206.6842},
year = {2012}
}
备注
Appears in Proceedings of the Twenty-Second Conference on Uncertainty in Artificial Intelligence (UAI2006)