中文

在混淆神经网络和语言模型中注入不可检测的后门

机器学习 2024-09-10 v2 密码学与安全 机器学习

摘要

随着机器学习模型变得越来越复杂,并在金融和医疗等高风险领域变得不可或缺,它们也更容易受到复杂的对抗性攻击。我们研究了由阴险的外部专家公司开发的模型中存在的不可检测后门所带来的威胁,如Goldwasser等人(FOCS '22)所定义。当存在这样的后门时,它们允许模型的设计者出售关于如何轻微扰动其输入以改变模型结果的信息。我们开发了一种通用策略,将后门植入混淆神经网络中,这些网络满足著名的不可区分混淆概念的安全属性。在发布神经网络之前应用混淆是一种有充分动机的策略,用于保护外部专家公司的敏感信息。我们的后门植入方法确保即使混淆模型的权重和架构可访问,后门的存在仍然不可检测。最后,我们将不可检测后门的概念引入语言模型,并基于隐写函数的存在将我们的神经网络后门攻击扩展到此类模型。

关键词

引用

@article{arxiv.2406.05660,
  title  = {Injecting Undetectable Backdoors in Obfuscated Neural Networks and Language Models},
  author = {Alkis Kalavasis and Amin Karbasi and Argyris Oikonomou and Katerina Sotiraki and Grigoris Velegkas and Manolis Zampetakis},
  journal= {arXiv preprint arXiv:2406.05660},
  year   = {2024}
}