中文

PromptFix:基于对抗式提示调优的少样本后门移除方法

计算与语言 2024-06-10 v1 机器学习

摘要

预训练语言模型(PLMs)过去几年因其卓越性能而引起了广泛关注。与此同时,训练 PLMs 的高昂成本以及其惊人的通用性共同推动了少样本微调和提示技术成为自然语言处理(NLP)模型最流行的训练范式。然而,既有研究表明,这些 NLP 模型可能会被植入后门,当触发器 token 被输入时,模型行为将被操控。本文提出 PromptFix,一种通过少样本场景下的对抗式提示调优实现的后门缓解策略。不同于现有 NLP 后门移除方法依赖精确触发器逆推并进行后续模型微调,PromptFix 保持模型参数不变,仅使用两组额外的软 token 分别模拟触发器并进行抵消。软 token 的使用以及对抗优化消除了对枚举可能后门配置的需求,使触发器寻找与性能保留之间实现自适应平衡。针对各种后门攻击进行实验验证了所提方法的有效性,并通过在域迁移情境下的性能表现进一步显示 PromptFix 适用于预训练于未知数据源的模型,这是提示调优场景中常见的情况。

关键词

引用

@article{arxiv.2406.04478,
  title  = {PromptFix: Few-shot Backdoor Removal via Adversarial Prompt Tuning},
  author = {Tianrong Zhang and Zhaohan Xi and Ting Wang and Prasenjit Mitra and Jinghui Chen},
  journal= {arXiv preprint arXiv:2406.04478},
  year   = {2024}
}

备注

NAACL 2024