中文

模仿好的并避免坏的:一种安全强化学习的增量方法

机器学习 2024-08-09 v4 人工智能

摘要

在强化学习中实施安全动作的一个流行框架是约束强化学习,其中采用基于轨迹的期望成本(或其他成本度量)约束来实施安全,更重要的是,这些约束是在最大化期望奖励的同时被实施的。解决约束强化学习的大多数最新方法将基于轨迹的成本约束转化为一个替代问题,该问题可以通过对强化学习方法进行微小修改来解决。此类方法的一个关键缺点是在每个状态下对成本约束的高估或低估。因此,我们提供了一种不修改基于轨迹的成本约束的方法,而是模仿由逐步改进的策略生成的“好”轨迹并避免“坏”轨迹。我们采用一个预言机,它利用奖励阈值(随学习过程变化)和总体成本约束将轨迹标记为“好”或“坏”。我们方法的一个关键优势是,我们能够从任何起始策略或轨迹集合开始工作并对其进行改进。在一组详尽的实验中,我们证明我们的方法在期望成本、CVaR 成本甚至未知成本约束方面,均能够超越解决约束强化学习问题的顶级基准方法。

关键词

引用

@article{arxiv.2312.10385,
  title  = {Imitate the Good and Avoid the Bad: An Incremental Approach to Safe Reinforcement Learning},
  author = {Huy Hoang and Tien Mai and Pradeep Varakantham},
  journal= {arXiv preprint arXiv:2312.10385},
  year   = {2024}
}