中文

多目标SPIBB:有限MDP中具有安全约束的Seldonian离线策略改进

机器学习 2021-11-01 v2

摘要

我们研究离线强化学习(RL)设定下带约束的安全策略改进(SPI)问题。我们考虑如下场景:(i)我们有一个在已知基线策略下收集的数据集,(ii)从环境中接收到多个奖励信号,从而引出同样多的待优化目标。我们针对该RL设定提出了一种SPI形式化方法,该方法考虑了算法用户对于处理不同奖励信号间权衡的偏好,同时确保新策略在每个单独目标上至少与基线策略表现相当。我们基于传统SPI算法,提出了一种基于带基线自举的安全策略迭代(SPIBB,Laroche等人,2019)的新方法,该方法在真实环境中为智能体的性能提供高概率保证。我们在合成网格世界安全任务以及真实世界重症监护场景中展示了我们方法的有效性,后者用于学习一种治疗脓毒症的静脉输液与血管加压药给药策略。

关键词

引用

@article{arxiv.2106.00099,
  title  = {Multi-Objective SPIBB: Seldonian Offline Policy Improvement with Safety Constraints in Finite MDPs},
  author = {Harsh Satija and Philip S. Thomas and Joelle Pineau and Romain Laroche},
  journal= {arXiv preprint arXiv:2106.00099},
  year   = {2021}
}