中文

训练时攻击的自适应折扣

机器学习 2024-01-08 v1 人工智能 密码学与安全

摘要

在强化学习(RL)解决方案中最隐蔽的攻击之一是训练时攻击(TTA),它在学习行为中制造漏洞和后门。除了简单的破坏,现在还有建设性TTA(C-TTA),攻击者迫使训练中的RL智能体(受害者)表现出特定的目标行为。然而,即使是最先进的C-TTA也专注于那些如果不是因为环境动态的某个特征(C-TTA利用该特征)而可能被受害者自然采用的目标行为。在这项工作中,我们表明,即使目标行为由于环境动态以及相对于受害者目标的非最优性而无法采用,C-TTA也是可能的。为了在这种情况下找到有效的攻击,我们开发了一种专门的DDPG算法变体,称为gammaDDPG,它学习这种更强版本的C-TTA。gammaDDPG根据受害者当前行为动态改变攻击策略规划范围。这改善了攻击时间线中的努力分配,并减少了攻击者对受害者的不确定性影响。为了展示我们方法的特性并更好地将结果与先前研究联系起来,我们借用了一个最先进C-TTA中的3D网格域进行实验。代码可在“bit.ly/github-rb-gDDPG”获取。

关键词

引用

@article{arxiv.2401.02652,
  title  = {Adaptive Discounting of Training Time Attacks},
  author = {Ridhima Bector and Abhay Aradhya and Chai Quek and Zinovi Rabinovich},
  journal= {arXiv preprint arXiv:2401.02652},
  year   = {2024}
}

备注

19 pages, 7 figures