用分布内触发剂毒化深度强化学习智能体
机器学习
2021-06-16 v1 密码学与安全
摘要
本文提出一种新的数据投毒攻击,并将其应用于深度强化学习智能体。我们的攻击核心在于所谓分布内触发剂,即原生存在于模型将被训练及部署于其中的数据分布的触发剂。我们概述了一个简单流程,遵循多任务学习范式在深度强化学习智能体中嵌入这些及其他触发剂,并在三种常见强化学习环境中予以演示。我们认为该工作对深度学习模型的安全性具有重要启示。
引用
@article{arxiv.2106.07798,
title = {Poisoning Deep Reinforcement Learning Agents with In-Distribution Triggers},
author = {Chace Ashcraft and Kiran Karra},
journal= {arXiv preprint arXiv:2106.07798},
year = {2021}
}
备注
4 pages, 1 figure, Published at ICLR 2021 Workshop on Security and Safety in Machine Learning Systems