中文

强化学习中状态与动作空间的安全探索

机器学习 2014-02-05 v1 人工智能

摘要

本文探讨了强化学习中的安全探索这一重要问题。虽然强化学习非常适合具有复杂转移动力学和高维状态 - 动作空间的领域,但安全且高效的探索需求带来了额外的挑战。传统的探索技术对于解决危险任务并不特别有用,因为在这些任务中,试错过程可能导致选择某些动作,其在特定状态下的执行可能会对学习系统(或任何其他系统)造成损害。因此,当智能体开始与危险且高维的状态 - 动作空间进行交互时,一个重要的问题随之产生;即如何避免(或至少最小化)由状态 - 动作空间探索引起的损害。我们提出了 PI-SRL 算法,该算法能够安全地改进连续状态和动作控制任务中次优但鲁棒的行为,并有效地从环境获得的经验中学习。我们在四个复杂任务中评估了所提出的方法:自动泊车、倒立摆平衡、直升机悬停和商业管理。

关键词

引用

@article{arxiv.1402.0560,
  title  = {Safe Exploration of State and Action Spaces in Reinforcement Learning},
  author = {Javier Garcia and Fernando Fernandez},
  journal= {arXiv preprint arXiv:1402.0560},
  year   = {2014}
}