关于导航强化学习中循环检测的收敛性
机器学习
2016-01-06 v2 人工智能
摘要
我们考虑一个强化学习框架,其中智能体必须从起始状态导航到目标状态。我们证明了一类我们称之为可归约任务的循环检测学习算法的收敛性。可归约任务具有无环解。我们还从语法上刻画了最终策略的形式。这种刻画可用于在模拟中精确检测收敛点。我们的结果表明,即便简单算法也能成功学习一大类非平凡任务。此外,我们的框架是初等的,因为我们仅使用基本概念来形式化证明收敛性。
引用
@article{arxiv.1511.08724,
title = {On the convergence of cycle detection for navigational reinforcement learning},
author = {Tom J. Ameloot and Jan Van den Bussche},
journal= {arXiv preprint arXiv:1511.08724},
year = {2016}
}