利用来自层次感知策略的模仿学习发现层次结构
机器学习
2019-08-06 v2 人工智能
摘要
学习使智能体展现时间上更高阶行为的选项,已被证明有助于增强探索、降低样本复杂度以及适用于多种迁移场景。深度选项发现(DDO)是一种直接从专家轨迹中学习层次策略及选项的生成式算法。我们对不同领域中由 DDO 推断出的选项进行了定性与定量分析。为此,我们提出了如选项终止条件、铰链值函数误差和基于 KL 散度的距离度量等不同价值度量来比较各种方法。分析选项的终止条件及其运行的时间步数揭示出选项过早终止。我们提出了可轻松纳入的改进措施,缓解了短选项问题以及选项坍缩至同一模态的问题。
引用
@article{arxiv.1812.00225,
title = {Discovering hierarchies using Imitation Learning from hierarchy aware policies},
author = {Ameet Deshpande and Harshavardhan Kamarthi and Balaraman Ravindran},
journal= {arXiv preprint arXiv:1812.00225},
year = {2019}
}