中文

Mithridates:审计并提升机器学习流水线的后门抗性

密码学与安全 2023-12-20 v3 计算机视觉与模式识别 机器学习

摘要

在可能来自不可信来源的数据上训练的机器学习(ML)模型易受投毒攻击。训练输入中一小部分恶意构造的子集可使模型除主任务外还学习一个“后门”任务(例如,将具有某特征的输入误分类)。近期研究提出了许多假想的后门攻击,其有效性严重依赖于目标模型的配置和训练超参数。鉴于潜在后门攻击的多样性,非安全专家的 ML 工程师无法衡量其当前训练流水线有多脆弱,也没有实用方法比较训练配置以挑选抗性更强的配置。部署防御需要从数十篇研究论文中评估并选择,且重新设计训练流水线。本文旨在为 ML 工程师提供实用工具,以审计其训练流水线的后门抗性并比较不同训练配置,从而帮助选择最佳平衡准确率与安全性的方案。首先,我们提出一种通用的、攻击无关的抗性度量,基于必须被篡改的最小训练输入数(在此之前模型不会学到任何后门)。其次,我们设计、实现并评估了 Mithridates,一种将后门抗性整合进训练配置搜索的多阶段方法。ML 开发者已依赖超参数搜索寻找最大化模型准确率的配置。Mithridates 扩展了这一标准工具,在不破坏训练流水线的情况下平衡准确率与抗性。我们表明,Mithridates 找到的超参数将多种后门攻击的抗性提升 3-5 倍,仅对准确率有轻微影响。我们还讨论了向 AutoML 和联邦学习的扩展。

关键词

引用

@article{arxiv.2302.04977,
  title  = {Mithridates: Auditing and Boosting Backdoor Resistance of Machine Learning Pipelines},
  author = {Eugene Bagdasaryan and Vitaly Shmatikov},
  journal= {arXiv preprint arXiv:2302.04977},
  year   = {2023}
}