基于集成的不确定性敏感学习与规划
机器学习
2020-03-05 v3 人工智能
机器学习
摘要
我们提出了一种用于离散环境的强化学习框架,其中智能体同时作出战略性与战术性决策。前者通过价值函数的使用体现,后者由树搜索规划器驱动。这些工具互为补充。规划模块执行局部的 \textit{假设} 分析,从而得以避免战术陷阱并增强价值函数的备份。价值函数具有全局性质,弥补了规划器固有的局部性。为进一步巩固这种协同,我们引入了一种具有两个独特组成部分的探索机制:不确定性建模与风险度量。为建模不确定性,我们使用价值函数集成;为反映风险,我们使用所提出的若干泛函来概括集成所隐含的信息。我们展示了我们的方法在困难探索环境:Deep-sea、玩具版 Montezuma's Revenge 与 Sokoban 上表现良好。在所有案例中,我们均获得了学习加速与性能提升。
引用
@article{arxiv.1912.09996,
title = {Uncertainty-sensitive Learning and Planning with Ensembles},
author = {Piotr Miłoś and Łukasz Kuciński and Konrad Czechowski and Piotr Kozakowski and Maciek Klimek},
journal= {arXiv preprint arXiv:1912.09996},
year = {2020}
}