TrojFSP:少样本提示微调中的木马插入
机器学习
2024-03-20 v3
摘要
提示微调是将固定的预训练语言模型 (PLM) 适配到各种下游任务的最有效解决方案之一,尤其是在仅有少量输入样本的情况下。然而,针对少量数据样本进行提示微调的安全问题(例如木马攻击)尚未得到充分研究。将已有的数据投毒攻击直接迁移到少样本提示微调中面临多重挑战。一个重要问题是“投毒不平衡问题”,即将非目标类样本添加到目标类中,导致目标类样本数量多于非目标类。虽然该问题在常规微调中并不严重,但它会显著阻碍少样本提示微调,使其难以同时实现高攻击成功率 (ASR) 并保持干净数据准确率 (CDA)。此外,少样本提示在 ASR 和 CDA 方面均容易过拟合。本文提出了 TrojFSP,一种旨在解决上述挑战的方法。为解决投毒不平衡问题,我们开发了 Target-Class Shrink (TC-Shrink) 技术,旨在均衡投毒样本数量。为对抗过拟合,我们采用 Selective Token Poisoning 技术来提升攻击性能。此外,我们引入了 Trojan-Trigger Attention 目标函数,以放大投毒木马提示对触发器的注意力。实验表明,我们的 TrojFSP 在各种 PLM 和数据集上实现了超过 99% 的 ASR,同时保持 CDA 的下降可忽略不计。
引用
@article{arxiv.2312.10467,
title = {TrojFSP: Trojan Insertion in Few-shot Prompt Tuning},
author = {Mengxin Zheng and Jiaqi Xue and Xun Chen and YanShan Wang and Qian Lou and Lei Jiang},
journal= {arXiv preprint arXiv:2312.10467},
year = {2024}
}
备注
9 pages, 2 figures