中文

通过反馈实现约束型强化学习中的安全性

人工智能 2025-01-14 v3

摘要

在安全关键型的强化学习场景中,通常倾向于采用额外的约束函数,而非艰巨的修改奖励函数以确保智能体的安全行为。然而,设计或评估此类约束函数可能代价高昂。例如,在自动驾驶领域,设计涵盖所有不安全行为(如激进变道)的约束函数是天然复杂的。在此类情境下,约束函数可从训练轮次之间收集的离线反馈中学习得出。这种反馈可能是系统生成的,或来自人类观察者对训练过程的观察。以往方法无法应用于复杂环境,且局限于仅接收状态级别的反馈,而这在实际中可能代价高昂。为此,我们提出一种可扩展至更复杂领域的方法,并扩展至状态级别之外的反馈,从而减轻评估者的负担。在此类设置下推断约束函数具有挑战,尤其是如何基于轨迹级别的反馈为 individual 状态分配信用。为解决此问题,我们提出一种代理目标函数,将问题转化为具有噪声标签的状态级别监督分类任务,可高效求解。此外,收集智能体生成的每个轨迹的反馈往往不可行,因此,两个根本问题随之而来:(1)应向人类展示哪些轨迹?(2)多少轨迹足以实现有效学习?为解决这些问题,我们引入基于新颖性的抽样方法(novelty-based sampling),仅在智能体遇到新颖轨迹时才主动邀请评估者参与。我们通过在多个基准Safety Gymnasium环境以及现实自驾场景中的实验,展示了该方法的高效性。

关键词

引用

@article{arxiv.2406.19626,
  title  = {Safety through feedback in Constrained RL},
  author = {Shashank Reddy Chirra and Pradeep Varakantham and Praveen Paruchuri},
  journal= {arXiv preprint arXiv:2406.19626},
  year   = {2025}
}

备注

Accepted at NeurIPS 2024 (Poster)