元强化学习中的采样攻击:极小极大公式与复杂度分析
机器学习
2023-03-09 v2 密码学与安全
摘要
元强化学习(meta RL)作为元学习思想与强化学习(RL)的结合,使智能体能够利用少量样本适应不同任务。然而,这种基于采样的适应也使 meta RL 易受对抗攻击。通过操纵 meta RL 中采样过程的奖励反馈,攻击者可以误导智能体从训练经验中建立错误知识,从而恶化其在适应后处理不同任务时的性能。本文为理解此类安全风险提供了博弈论基础。具体而言,我们将采样攻击模型正式定义为攻击者与智能体之间的 Stackelberg 博弈,由此导出极小极大公式。它引出了两种在线攻击方案:间歇攻击与持续攻击,使攻击者能在 次迭代内学到由 -一阶平稳点定义的最优采样攻击。这些攻击方案无需与环境额外交互即可并发搭车学习进程。通过将收敛结果与数值实验相印证,我们观察到攻击者的微小代价即可显著恶化学习性能,且极小极大方法也有助于使 meta RL 算法更鲁棒。
引用
@article{arxiv.2208.00081,
title = {Sampling Attacks on Meta Reinforcement Learning: A Minimax Formulation and Complexity Analysis},
author = {Tao Li and Haozhe Lei and Quanyan Zhu},
journal= {arXiv preprint arXiv:2208.00081},
year = {2023}
}
备注
updates: github repo posted