FCert:基础模型时代可认证鲁棒的少样本分类
密码学与安全
2024-04-15 v1
摘要
使用基础模型(如CLIP、DINOv2、PaLM-2)的少样本分类使用户能够利用少量带标签的训练样本(称为支持样本)为分类任务构建准确的分类器。然而,攻击者可以通过操纵一些支持样本来执行数据投毒攻击,使得分类器对测试输入做出攻击者期望的任意预测。经验性防御无法提供形式化的鲁棒性保证,导致攻击者与防御者之间陷入猫鼠游戏。现有的可认证防御是为传统监督学习设计的,当扩展到少样本分类时性能次优。在我们的工作中,我们提出了FCert,这是首个针对少样本分类数据投毒攻击的可认证防御。我们证明,当被投毒的支持样本总数有界时,FCert能够可证明地对测试输入预测相同的标签。我们在OpenAI、Meta和Google发布的基础模型上,对视觉和文本领域的基准少样本分类数据集进行了大量实验。我们的实验结果表明,FCert:1)在无攻击时保持分类准确率,2)优于现有的针对数据投毒攻击的最先进可认证防御,3)高效且通用。
引用
@article{arxiv.2404.08631,
title = {FCert: Certifiably Robust Few-Shot Classification in the Era of Foundation Models},
author = {Yanting Wang and Wei Zou and Jinyuan Jia},
journal= {arXiv preprint arXiv:2404.08631},
year = {2024}
}
备注
To appear in IEEE Symposium on Security and Privacy, 2024