中文

通过引导式安全探索的强化学习

机器学习 2024-03-22 v1 人工智能

摘要

安全性对于拓宽强化学习(RL)的应用至关重要。通常,我们在受控环境(如实验室)中训练 RL 智能体,再将其部署到真实世界。然而,真实世界目标任务在部署前可能未知。无奖励 RL 在奖励揭示前训练智能体而不使用奖励,以便一旦奖励揭示便能快速适应。我们考虑受限无奖励设定,其中智能体(引导者)学习在无奖励信号下安全探索。该智能体在受控环境中训练,环境允许不安全交互且仍提供安全信号。目标任务揭示后,不再允许安全违规。因此,利用引导者来组合安全行为策略。借鉴迁移学习,当学生策略不可靠时,我们还将其正则化朝向引导者,并随训练推进逐步消除引导者影响。实证分析表明,该方法可实现安全迁移学习,并帮助学生更快解决目标任务。

关键词

引用

@article{arxiv.2307.14316,
  title  = {Reinforcement Learning by Guided Safe Exploration},
  author = {Qisong Yang and Thiago D. Simão and Nils Jansen and Simon H. Tindemans and Matthijs T. J. Spaan},
  journal= {arXiv preprint arXiv:2307.14316},
  year   = {2024}
}

备注

Accecpted at ECAI 2023