PoisonedEncoder:在对比学习的无标签预训练数据中下毒
密码学与安全
2023-01-04 v3 计算机视觉与模式识别
机器学习
摘要
对比学习利用大量无标签数据预训练图像编码器,使得该图像编码器可作为各类下游任务的通用特征提取器。本文提出 PoisonedEncoder,一种针对对比学习的数据投毒攻击。具体而言,攻击者将精心构造的投毒输入注入无标签预训练数据中,使得基于该被毒化编码器构建的、面向多个目标下游任务的下游分类器,同时将攻击者选定的任意干净输入分类为攻击者选定的任意类别。我们将该数据投毒攻击建模为一个双层优化问题,其解为投毒输入集合;并提出了一种面向对比学习的定制方法来近似求解。我们在多个数据集上的评估表明,PoisonedEncoder 在保持基于被毒化编码器构建的、针对非攻击者选定输入的下游分类器测试准确率的同时,实现了高攻击成功率。我们还评估了五种针对 PoisonedEncoder 的防御方法,包括一种预处理、三种处理中和一种后处理防御。结果表明,这些防御能降低 PoisonedEncoder 的攻击成功率,但也会牺牲编码器的效用或需要大量干净预训练数据集。
引用
@article{arxiv.2205.06401,
title = {PoisonedEncoder: Poisoning the Unlabeled Pre-training Data in Contrastive Learning},
author = {Hongbin Liu and Jinyuan Jia and Neil Zhenqiang Gong},
journal= {arXiv preprint arXiv:2205.06401},
year = {2023}
}
备注
USENIX Security Symposium, 2022