理解子群体对投毒攻击的易感性差异
机器学习
2023-11-21 v1 密码学与安全
摘要
机器学习易受投毒攻击,攻击者可控制训练数据的很小一部分,并选择这些数据以诱导训练模型中模型开发者未预期的行为。我们考虑一种现实设定:能够插入有限数量数据点的对手试图控制模型在特定子群体上的行为。受先前关于随机标签翻转攻击对不同子群体效果存在差异的观察启发,我们研究了可能影响最先进投毒攻击针对不同子群体有效性的性质。对于一类二维合成数据集,我们经验性地发现,对于可分性较低的数据集,数据集可分性在子群体脆弱性中起主导作用。然而,良好分离的数据集表现出对个别子群体性质的更强依赖。我们进一步发现,一个关键的子群体性质由干净数据集上干净模型与误分类该子群体的目标模型之间的损失差所刻画,若损失差较小,则子群体更易受攻击。该性质也推广到高维基准数据集。对于 Adult 基准数据集,我们表明可找到与所选一组子群体易感性相关的具语义意义的子群体性质。本文结果配有位于 https://uvasrg.github.io/visualizing-poisoning 的完全交互式基于网络的子群体投毒攻击可视化。
引用
@article{arxiv.2311.11544,
title = {Understanding Variation in Subpopulation Susceptibility to Poisoning Attacks},
author = {Evan Rose and Fnu Suya and David Evans},
journal= {arXiv preprint arXiv:2311.11544},
year = {2023}
}
备注
18 pages, 11 figures