不理解,不使用:用层间过滤器消除木马
机器学习
2024-07-10 v1 计算与语言
密码学与安全
摘要
大型语言模型(LLM)有时会表现出危险的意外行为。发现并修复这些问题具有挑战性,因为攻击面巨大——无法穷举搜索所有可能引发此类行为的输入。一个特别棘手的具体情况是数据投毒注入的木马,因为无法知道它们是什么从而进行搜索。据我们所知,目前没有通用方法可以“遗忘”预训练过程中注入的未知木马。这项工作旨在提供一种通用配方(过滤器)和一种具体实现(LoRA过滤器),该过滤器可在中小型模型上实际工作。重点主要是实证性的,尽管一些令人费解的行为为LLM如何存储和处理信息这一基本问题打开了大门。不出所料,我们发现我们的过滤器在残差流和最后几层上效果最佳。
引用
@article{arxiv.2407.06411,
title = {If You Don't Understand It, Don't Use It: Eliminating Trojans with Filters Between Layers},
author = {Adriano Hernandez},
journal= {arXiv preprint arXiv:2407.06411},
year = {2024}
}
备注
11 pages, 6 figures