中文

利用来自层次感知策略的模仿学习发现层次结构

机器学习 2019-08-06 v2 人工智能

摘要

学习使智能体展现时间上更高阶行为的选项,已被证明有助于增强探索、降低样本复杂度以及适用于多种迁移场景。深度选项发现(DDO)是一种直接从专家轨迹中学习层次策略及选项的生成式算法。我们对不同领域中由 DDO 推断出的选项进行了定性与定量分析。为此,我们提出了如选项终止条件、铰链值函数误差和基于 KL 散度的距离度量等不同价值度量来比较各种方法。分析选项的终止条件及其运行的时间步数揭示出选项过早终止。我们提出了可轻松纳入的改进措施,缓解了短选项问题以及选项坍缩至同一模态的问题。

关键词

引用

@article{arxiv.1812.00225,
  title  = {Discovering hierarchies using Imitation Learning from hierarchy aware policies},
  author = {Ameet Deshpande and Harshavardhan Kamarthi and Balaraman Ravindran},
  journal= {arXiv preprint arXiv:1812.00225},
  year   = {2019}
}