面向已部署情感分析模型的系统性攻击面缩减
密码学与安全
2020-06-22 v1 机器学习
机器学习
摘要
本工作提出了一种在部署后为模型建立基线、识别攻击向量并保护机器学习模型的结构化方法。这种在部署后保护每个模型的方法称为 BAD(构建、攻击与防御)架构。我们评估了 BAD 架构的两种实现,以量化一个黑盒情感分析系统的对抗生命周期。作为一项具有挑战性的诊断,我们选择 Jigsaw Toxic Bias 数据集作为我们性能工具中的基线。该架构的每种实现都将构建一份基线性能报告、攻击一个常见弱点并防御 incoming 攻击。需要着重说明:本工作中展示的每个攻击面都是可检测且可预防的。目标是展示一种在生产环境中保护机器学习模型的可行方法论。
引用
@article{arxiv.2006.11130,
title = {Systematic Attack Surface Reduction For Deployed Sentiment Analysis Models},
author = {Josh Kalin and David Noever and Gerry Dozier},
journal= {arXiv preprint arXiv:2006.11130},
year = {2020}
}
备注
11 pages, 4 figures, 6th International Conference on Data Mining