中文

利用分层策略从干预中学习以实现安全学习

机器人学 2019-12-06 v1 人工智能 计算机视觉与模式识别 人机交互 机器学习

摘要

通过行为克隆(BC)的示范学习(LfD)在多项复杂任务上表现良好。然而,典型 LfD 方法的局限在于它要求对所有场景(包括算法已训练充分的场景)提供专家示范。近期提出的从干预中学习(LfI)通过使用专家监督者克服了该局限。专家监督者仅在其怀疑即将采取不安全动作时进行干预。尽管 LfI 显著优于 LfD,最先进的 LfI 未能考虑由专家反应时间引起的延迟,且只学习短期行为。我们通过以下方式解决这些局限:1)将专家的干预向后时间插值,2)将策略拆分为两个分层层级,一个生成未来的子目标,另一个生成抵达这些期望子目标的动作。该子目标预测迫使算法学习长期行为,同时对专家反应时间具有鲁棒性。我们的实验表明,在分层策略框架中使用子目标的 LfI 比典型 LfD 训练更快且达到更好的渐近性能。

关键词

引用

@article{arxiv.1912.02241,
  title  = {Learning from Interventions using Hierarchical Policies for Safe Learning},
  author = {Jing Bi and Vikas Dhiman and Tianyou Xiao and Chenliang Xu},
  journal= {arXiv preprint arXiv:1912.02241},
  year   = {2019}
}

备注

Accepted for publication at the Thirty-Fourth AAAI Conference on Artificial Intelligence (AAAI-20)