中文

面向实际应用的声明引导文本后门攻击

计算与语言 2024-09-26 v1 人工智能 密码学与安全

摘要

自然语言处理的最新进展以及大语言模型日益广泛的使用暴露了新的安全漏洞,例如后门攻击。先前的后门攻击需要在模型分发后进行输入操纵以激活后门,这在现实世界的适用性上存在局限。针对这一空白,我们提出了一种新颖的声明引导后门攻击,它通过利用固有的文本声明作为触发器,消除了对此类操纵的需求。CGBA 利用声明提取、聚类和定向训练,诱骗模型在目标声明上表现异常,同时不影响其在干净数据上的性能。CGBA 在各种数据集和模型上展示了其有效性和隐蔽性,显著增强了实际后门攻击的可行性。我们的代码和数据将发布于 https://github.com/PaperCGBA/CGBA。

关键词

引用

@article{arxiv.2409.16618,
  title  = {Claim-Guided Textual Backdoor Attack for Practical Applications},
  author = {Minkyoo Song and Hanna Kim and Jaehan Kim and Youngjin Jin and Seungwon Shin},
  journal= {arXiv preprint arXiv:2409.16618},
  year   = {2024}
}

备注

Under Review