中文

运行时间保障如何影响强化学习智能体训练与性能的消融研究

机器学习 2024-05-22 v1 系统与控制 系统与控制

摘要

随着机器学习算法与方法的成功不断增长,强化学习(RL)已成为一个日益重要的研究领域。为应对训练期间赋予 RL 智能体的自由所带来的安全担忧,关于安全强化学习(SRL)的工作有所增加。然而,这些新颖且安全的方法所受审视少于其不安全对应方法。例如,安全方法之间的比较常常缺乏跨相似初始条件边界与超参数设置的公平评估、使用不佳的评估指标,并挑拣最佳训练运行而非对多个随机种子取平均。在本工作中,我们采用评估最佳实践进行消融研究,以调查运行时间保障(RTA)——其监控系统状态并干预以保证安全——对有效学习的影响。通过研究同策略与异策略 RL 算法中的多种 RTA 方法,我们试图理解哪些 RTA 方法最有效、智能体是否变得依赖 RTA,以及奖励塑形与安全探索在 RL 智能体训练中的重要性。我们的结论揭示了 SRL 最有前景的方向,且我们的评估方法学为未来 SRL 工作中创建更好的比较奠定了基础。

关键词

引用

@article{arxiv.2207.04117,
  title  = {Ablation Study of How Run Time Assurance Impacts the Training and Performance of Reinforcement Learning Agents},
  author = {Nathaniel Hamilton and Kyle Dunlap and Taylor T Johnson and Kerianne L Hobbs},
  journal= {arXiv preprint arXiv:2207.04117},
  year   = {2024}
}