中文

PoisonedEncoder:在对比学习的无标签预训练数据中下毒

密码学与安全 2023-01-04 v3 计算机视觉与模式识别 机器学习

摘要

对比学习利用大量无标签数据预训练图像编码器,使得该图像编码器可作为各类下游任务的通用特征提取器。本文提出 PoisonedEncoder,一种针对对比学习的数据投毒攻击。具体而言,攻击者将精心构造的投毒输入注入无标签预训练数据中,使得基于该被毒化编码器构建的、面向多个目标下游任务的下游分类器,同时将攻击者选定的任意干净输入分类为攻击者选定的任意类别。我们将该数据投毒攻击建模为一个双层优化问题,其解为投毒输入集合;并提出了一种面向对比学习的定制方法来近似求解。我们在多个数据集上的评估表明,PoisonedEncoder 在保持基于被毒化编码器构建的、针对非攻击者选定输入的下游分类器测试准确率的同时,实现了高攻击成功率。我们还评估了五种针对 PoisonedEncoder 的防御方法,包括一种预处理、三种处理中和一种后处理防御。结果表明,这些防御能降低 PoisonedEncoder 的攻击成功率,但也会牺牲编码器的效用或需要大量干净预训练数据集。

关键词

引用

@article{arxiv.2205.06401,
  title  = {PoisonedEncoder: Poisoning the Unlabeled Pre-training Data in Contrastive Learning},
  author = {Hongbin Liu and Jinyuan Jia and Neil Zhenqiang Gong},
  journal= {arXiv preprint arXiv:2205.06401},
  year   = {2023}
}

备注

USENIX Security Symposium, 2022