大语言模型的隐形编辑
人工智能
2024-10-31 v2 机器学习
摘要
本文揭示了编辑大语言模型的理论基础,并提出了无需重新训练的新方法。我们的理论发现,单一度量(即模型特征内在维度的度量)可用于评估模型的可编辑性,并揭示其此前未被认识的对恶意隐形攻击的易感性。该度量是预测各种编辑方法成功性的核心指标,并在不同编辑方法家族之间建立了新的联系。我们统称为这些方法为隐形编辑,因为它们直接更新模型权重,以指定对特定已知误生成提示的响应,而不影响其他模型行为。通过严格应用理论见解,我们引入了一种新型 jet-pack 网络模块,专为高度选择性模型编辑优化,仅使用标准网络操作,可插入现有网络中。我们还揭示了语言模型对隐形攻击的脆弱性:对模型权重进行小幅修改,即可修复其对单个攻击者选定提示的响应。隐形攻击计算简单,无需获取或了解模型的训练数据,因此构成对重新分发的基础模型的强大且此前未被认识的威胁。大量实验结果说明并支持我们的方法及其理论依据。演示及源码已公开于 https://github.com/qinghua-zhou/stealth-edits。
关键词
引用
@article{arxiv.2406.12670,
title = {Stealth edits to large language models},
author = {Oliver J. Sutton and Qinghua Zhou and Wei Wang and Desmond J. Higham and Alexander N. Gorban and Alexander Bastounis and Ivan Y. Tyukin},
journal= {arXiv preprint arXiv:2406.12670},
year = {2024}
}
备注
28 pages, 14 figures. Open source implementation: https://github.com/qinghua-zhou/stealth-edits