中文

PolicyCleanse:强化学习中的后门检测与缓解

机器学习 2023-09-15 v5 人工智能

摘要

随着强化学习在现实世界中的应用日益普及,RL 系统的安全性与鲁棒性值得更多关注与探索。特别地,近期工作揭示,在多智能体 RL 环境中,后门触发动作可被注入受害智能体(亦称特洛伊智能体),其一旦观察到后门触发动作便会导致灾难性失败。为保障 RL 智能体抵御恶意后门,本工作提出多智能体竞争强化学习系统中的后门检测问题,旨在检测特洛伊智能体及相应潜在触发动作,并进一步尝试缓解其特洛伊行为。为解决该问题,我们提出 PolicyCleanse,其基于被激活的特洛伊智能体在若干时间步后累积奖励明显下降这一性质。配合 PolicyCleanse,我们还设计了一种基于机器遗忘的方法,可有效缓解检测到的后门。大量实验表明,所提方法能准确检测特洛伊智能体,并在各类智能体与环境下的胜率上超越现有后门缓解基线方法至少 3%。

关键词

引用

@article{arxiv.2202.03609,
  title  = {PolicyCleanse: Backdoor Detection and Mitigation in Reinforcement Learning},
  author = {Junfeng Guo and Ang Li and Cong Liu},
  journal= {arXiv preprint arXiv:2202.03609},
  year   = {2023}
}

备注

Accepted by ICCV 2023