中文

Krait:针对图形提示调优的后门攻击

机器学习 2025-04-01 v2 密码学与安全

摘要

图形提示调优已成为有效将预训练模型中的通用图形知识传递到各种下游任务的热门范式,尤其在少样本情境下。然而,其对后门攻击的脆弱性——即对手插入触发器来操纵结果——引发了关键性关切。我们首次研究此类漏洞,揭示后门可伪装良性图形提示,从而规避检测。我们引入 Krait,一种新的图形提示后门。具体而言,我们提出一种简单而有效的模型无关指标,称为标签非均匀同质性,用于选择被毒化候选者,显著降低计算复杂度。为适应多样化的攻击情境和高级攻击类型,我们设计了三种可定制的触发器生成方法,以制造作为触发器的提示。我们提出一种基于聚类相似性的损失函数,以优化提示调优以实现攻击效果和隐蔽性。在四个真实图上进行实验,表明 Krait 能够仅通过 0.15% 至 2% 的训练节点嵌入触发器,实现高攻击成功率且不牺牲干净准确率。值得注意的是,在一对一和全体对一攻击中,Krait 可通过仅污染 2 和 22 个节点即可实现 100% 的攻击成功率。我们的实验进一步显示,Krait 在不同迁移情境、攻击类型和图神经网络背bone 中仍然高效。此外,Krait 成功扩展到黑箱设置中,构成更严重的威胁。最后,我们分析了 Krait 为何能规避经典和最新防御,并为检测和缓解此类攻击提供了实用见解。

关键词

引用

@article{arxiv.2407.13068,
  title  = {Krait: A Backdoor Attack Against Graph Prompt Tuning},
  author = {Ying Song and Rita Singh and Balaji Palanisamy},
  journal= {arXiv preprint arXiv:2407.13068},
  year   = {2025}
}

备注

Accepted by SaTML'2025