源于对比的捷径:基于提示学习中的有效且隐蔽的干净标签攻击
机器学习
2024-04-02 v1 人工智能
计算与语言
密码学与安全
摘要
基于提示的学习范式在增强预训练语言模型(PLMs)的适应性方面展现了显著的有效性,特别是在少样本场景下。然而,该学习范式已被证明易受后门攻击。当前的干净标签攻击采用特定提示作为触发器,无需外部触发器即可成功,并确保中毒样本的正确标注,相较于中毒标签攻击更为隐蔽;但另一方面,它面临严重的误激活问题并带来更大挑战,需要更高的中毒率。使用常规的负数据增强方法,我们发现在干净标签设置下很难在有效性与隐蔽性之间取得平衡。在解决此问题时,我们受到后门充当捷径这一概念的启发,并假设该捷径源于触发器与用于中毒的数据之间的对比。在本研究中,我们提出了一种名为对比捷径注入(CSI)的方法,通过利用激活值,整合触发器设计与数据选择策略以构建更强的捷径特征。通过在全样本与少样本文本分类任务上的大量实验,我们实证验证了 CSI 在低中毒率下具有高有效性与高隐蔽性。值得注意的是,我们发现这两种方法分别在全样本与少样本设置中起主导作用。
引用
@article{arxiv.2404.00461,
title = {Shortcuts Arising from Contrast: Effective and Covert Clean-Label Attacks in Prompt-Based Learning},
author = {Xiaopeng Xie and Ming Yan and Xiwen Zhou and Chenlong Zhao and Suli Wang and Yong Zhang and Joey Tianyi Zhou},
journal= {arXiv preprint arXiv:2404.00461},
year = {2024}
}
备注
10 pages, 6 figures, conference