中文

解决单任务数据投毒在无样本持续学习中的破坏性影响

密码学与安全 2025-08-12 v2 人工智能

摘要

我们的研究解决了持续学习(CL)中与数据投毒相关的被忽视的安全问题。数据投毒——即有意操纵训练数据以影响机器学习模型预测的行为——最近被证明对 CL 训练稳定性构成威胁。虽然现有文献主要关注场景依赖的攻击,但我们提出关注更简单、更现实的单任务投毒(STP)威胁。与先前提出的投毒设置不同,在 STP 中,攻击者缺乏对模型以及先前和未来任务的知识和访问权限。在攻击期间,他们只能访问数据流中的当前任务。我们的研究表明,即使在这些严格的条件下,攻击者也能使用标准图像损坏来破坏模型性能。我们证明 STP 攻击能够强烈破坏整个持续训练过程:降低算法的稳定性(其在过去任务上的性能)和可塑性(适应新任务的能力)。最后,我们提出了一个针对 CL 的高级防御框架以及一种基于任务向量的投毒任务检测方法。代码可在 https://github.com/stapaw/STP.git 获取。

关键词

引用

@article{arxiv.2507.04106,
  title  = {Addressing The Devastating Effects Of Single-Task Data Poisoning In Exemplar-Free Continual Learning},
  author = {Stanisław Pawlak and Bartłomiej Twardowski and Tomasz Trzciński and Joost van de Weijer},
  journal= {arXiv preprint arXiv:2507.04106},
  year   = {2025}
}

备注

Accepted at CoLLAs 2025