基于黑箱环境的强化学习在线投毒攻击
机器学习
2024-12-03 v1 密码学与安全
摘要
本文提出一种针对在黑箱环境中运行的强化学习智能体的在线环境投毒算法,攻击者有意操控训练数据以引导智能体走向恶意策略。与 prior 研究主要探讨白盒环境的不同,本文聚焦于攻击者对环境动力学"未知"且目标智能体采用的"灵活"强化学习算法的场景。我们首先提出一种能够投毒奖励函数和状态转换的攻击方案。将投毒任务形式化为约束优化问题,遵循 \cite{ma2019policy} 的框架。鉴于黑箱环境中转换概率对攻击者而言是未知的,我们采用随机梯度下降算法,其中通过样本估计近似精确梯度。随后采用惩罚方法结合双层重构,将问题转化为无约束问题,以规避双抽样问题。我们通过迷宫环境验证了算法的有效性。
引用
@article{arxiv.2412.00797,
title = {Online Poisoning Attack Against Reinforcement Learning under Black-box Environments},
author = {Jianhui Li and Bokang Zhang and Junfeng Wu},
journal= {arXiv preprint arXiv:2412.00797},
year = {2024}
}