终身强化学习中具有次线性遗憾的安全策略搜索
机器学习
2015-05-22 v1
摘要
终身强化学习为开发通用智能体提供了一个有前景的框架,这些智能体可以在一生经验中积累知识,并通过构建先前的知识快速学习新任务。然而,当前的终身学习方法随着经验量增加表现出非消失的遗憾,并且存在可能导致次优或不安全控制策略的局限性。为解决这些问题,我们开发了一种终身策略梯度学习器,它在对抗性设置中在线学习多个任务,同时对学到的策略强制安全约束。我们首次展示了终身策略搜索的次线性遗憾,并在几个基准动力系统和四旋翼控制应用中验证了我们的算法。
引用
@article{arxiv.1505.05798,
title = {Safe Policy Search for Lifelong Reinforcement Learning with Sublinear Regret},
author = {Haitham Bou Ammar and Rasul Tutunov and Eric Eaton},
journal= {arXiv preprint arXiv:1505.05798},
year = {2015}
}