中文

通过密码学变换器电路实现不可触发的语言模型后门

密码学与安全 2025-02-04 v2 机器学习

摘要

开源语言模型的快速扩散显著增加了下游后门攻击的风险。这些后门在模型部署期间可引入危险行为,并可规避常规网络安全监控系统的检测。本文引入一种新型的 transformer 模型后门,该后门与现有工作不同之处在于其不可触发性。不可触发性防止防御者触发后门,在给定完全白盒访问权限并使用自动化技术(如红队测试或某些形式化验证方法)的情况下,甚至无法对其进行正确的评估。我们表明,新型构造方式不仅由于采用密码学技术而具有不可触发性,而且具有良好的鲁棒性。我们在实证调查中确认了这些特性,并提供了证据表明这些后门能够抵抗最新的缓解策略。此外,我们进一步表明,尽管我们的通用后门在白盒环境下并非完全不可检测,但比某些现有设计更难被发现。通过演示如何无缝集成后门到 transformer 模型中,本文从根本上质疑了部署前检测策略的有效性。这为 AI 安全与安全性提供了新的见解。

关键词

引用

@article{arxiv.2406.02619,
  title  = {Unelicitable Backdoors in Language Models via Cryptographic Transformer Circuits},
  author = {Andis Draguns and Andrew Gritsevskiy and Sumeet Ramesh Motwani and Charlie Rogers-Smith and Jeffrey Ladish and Christian Schroeder de Witt},
  journal= {arXiv preprint arXiv:2406.02619},
  year   = {2025}
}

备注

19 pages, 7 figures