Prompt: 恶意攻击 - 基于提示的持续学习中的后门攻击
机器学习
2024-12-18 v2
摘要
基于提示的方法为持续学习中的数据隐私问题提供了前沿解决方案,特别是在涉及多个数据供应商且长期存储私人用户数据受禁止的情况下。尽管其卓越的记忆能力屈居于状态,仍可成为双刃剑,引发安全顾虑,因为它可能无意中保留着在从私人用户数据学习期间注入的受污化知识。紧随此洞见,本文将持续学习暴露于潜在威胁:后门攻击,使模型在特定触发器存在时遵循所需的对抗性目标,而在干净样本上仍正常运行。我们突显了在增量学习器上执行后门攻击的三个关键挑战,并提出相应解决方案:(1) \emph{可迁移性}: 我们采用替代数据集并操控提示选择,将后门知识传递至来自其他供应商的数据;(2) \emph{韧性}: 我们模拟受害者的静态和动态状态,以确保后门触发器在强烈的增量学习过程中保持稳健;(3) \emph{真实性}: 我们应用二元交叉熵损失作为反作弊因素,防止后门触发器退化为对抗噪声。广泛的实验在各种基准数据集和持续学习器上验证了我们的持续后门框架,在最高可达攻击成功率的同时,进一步的消融研究确认了我们的贡献的有效性。
引用
@article{arxiv.2406.19753,
title = {Attack On Prompt: Backdoor Attack in Prompt-Based Continual Learning},
author = {Trang Nguyen and Anh Tran and Nhat Ho},
journal= {arXiv preprint arXiv:2406.19753},
year = {2024}
}
备注
Accepted to AAAI 2025