面向长期对抗目标的智能体序列攻击
机器学习
2018-07-06 v2 人工智能
密码学与安全
计算机视觉与模式识别
机器学习
摘要
近年来,随着在策略网络上采用有效的深度神经网络(DNNs),强化学习(RL)取得了巨大进展。伴随其高效性而来的是 DNNs 严重的脆弱性问题:输入上的微小对抗扰动即可改变网络输出。已有若干工作指出,带有 DNN 策略网络的学习型智能体可通过在输入状态上施加一系列微小扰动而被操纵,从而无法完成原始任务。在本文中,我们进一步证明,通过一系列攻击亦有可能对受害策略网络强加任意对抗奖励。我们的方法采用了最新的对抗攻击技术——对抗变换网络(Adversarial Transformer Network, ATN),其可学习生成攻击且易于集成到策略网络中。作为我们攻击的结果,受害智能体被误导从而随时间优化该对抗奖励。我们的结果暴露了 RL 在安全关键系统(包括无人机、医学分析和自动驾驶汽车)中应用的严重安全威胁。
引用
@article{arxiv.1805.12487,
title = {Sequential Attacks on Agents for Long-Term Adversarial Goals},
author = {Edgar Tretschk and Seong Joon Oh and Mario Fritz},
journal= {arXiv preprint arXiv:1805.12487},
year = {2018}
}