对抗性廉价交谈
机器学习
2023-07-12 v4 人工智能
密码学与安全
摘要
强化学习(RL)中的对抗攻击常假设对受害者的参数、环境或数据具有高度特权访问。相反,本文提出一种称为廉价交谈 MDP 的新颖对抗设定,其中对抗者仅能向受害者的观测追加确定性消息,从而导致极小的影响范围。对抗者无法遮挡真值、影响底层环境动态或奖励信号、引入非平稳性、增加随机性、看到受害者的动作,或访问其参数。此外,我们提出一种称为对抗性廉价交谈(ACT)的简单元学习算法,用于在该设定下训练对抗者。我们证明,尽管设定高度受限,用 ACT 训练的对抗者仍显著影响受害者的训练与测试性能。影响训练时性能揭示了一种新攻击向量,并增进了对现有 RL 算法成功与失败模式的理解。更具体地,我们表明 ACT 对抗者能够通过干扰学习器的函数逼近损害性能,或通过输出有用特征帮助受害者性能。最后,我们表明 ACT 对抗者可在训练时操纵消息,以在测试时直接且任意地控制受害者。项目视频与代码见 https://sites.google.com/view/adversarial-cheap-talk
引用
@article{arxiv.2211.11030,
title = {Adversarial Cheap Talk},
author = {Chris Lu and Timon Willi and Alistair Letcher and Jakob Foerster},
journal= {arXiv preprint arXiv:2211.11030},
year = {2023}
}
备注
To be published at ICML 2023. Project video and code are available at https://sites.google.com/view/adversarial-cheap-talk