基于状态操纵的线性二次控制系统批学习中的策略投毒
系统与控制
2023-04-18 v2 系统与控制
摘要
本工作中,我们研究通过状态操纵(亦称传感器欺骗)进行的策略投毒,并具体关注智能体在线性二次(LQ)系统中通过批学习形成控制策略的情形。在此场景中,攻击者在智能体开始学习过程前通过操纵批数据,意图诱使学习者实施特定的恶意策略。我们构建了一种攻击模型以策略性地实施投毒,目标是尽可能少地修改批数据以避免被学习者察觉。我们建立了一个优化框架以指导此类策略投毒攻击的设计。优化问题中存在的双线性约束要求设计计算高效的算法以获得解。因此,我们开发了基于交替方向乘子法(ADMM)的迭代方案,能够返回近似最优的解。多个案例研究用于展示该算法在 LQ 控制系统批学习智能体上实施基于传感器攻击的有效性。
引用
@article{arxiv.2304.03815,
title = {Policy Poisoning in Batch Learning for Linear Quadratic Control Systems via State Manipulation},
author = {Courtney M. King and Son Tung Do and Juntao Chen},
journal= {arXiv preprint arXiv:2304.03815},
year = {2023}
}
备注
First appearing in Systems, Optimization and Control at CISS 2023