中文

未知动态下在线RL中感知漏洞的投毒机制

机器学习 2022-02-17 v5 密码学与安全 机器学习

摘要

对强化学习(RL)系统的投毒攻击可利用RL算法的漏洞并导致学习失败。然而,先前关于RL投毒的工作通常要么不切实际地假设攻击者知道底层马尔可夫决策过程(MDP),要么直接将监督学习中的投毒方法应用于RL。在本工作中,我们通过对RL中异质投毒模型的全面研究,构建了一个用于在线RL的通用投毒框架。在没有任何MDP先验知识的情况下,我们提出了一种称为感知漏洞的对抗性评论家投毒(VA2C-P)的策略性投毒算法,该算法适用于大多数基于策略的深度RL智能体,弥补了基于策略的RL智能体无投毒方法的空白。VA2C-P使用了一种新颖的度量——RL中的稳定性 radius(稳定半径),用于衡量RL算法的漏洞。在多个深度RL智能体和多个环境中的实验表明,我们的投毒算法以有限的攻击预算成功阻止智能体学习到良好策略或引导智能体收敛到目标策略。

关键词

引用

@article{arxiv.2009.00774,
  title  = {Vulnerability-Aware Poisoning Mechanism for Online RL with Unknown Dynamics},
  author = {Yanchao Sun and Da Huo and Furong Huang},
  journal= {arXiv preprint arXiv:2009.00774},
  year   = {2022}
}