基于模式识别的大语言模型木马检测
计算与语言
2025-01-22 v1 机器学习
摘要
木马后门可以在预训练、微调和上下文学习等各个阶段注入到大型语言模型中,构成对模型对齐的重大威胁。由于因果语言建模的特性,在庞大的搜索空间中检测这些触发器具有挑战性。本研究提出了一种用于检测大型语言模型中木马触发器的多阶段框架,包括标记过滤、触发器识别和触发器验证。我们讨论了现有的触发器识别方法,并提出了两种基于输出逻辑的黑盒触发器反转方法变体,分别利用束搜索和贪婪解码。我们指出验证阶段在整个过程中至关重要,提出了语义保持提示和特殊扰动,以区分实际木马触发器与其他显示相似特征的对抗字符串。在TrojAI和RLHF中毒模型数据集上的评估结果表明,我们的方法取得了有前景的成果。
引用
@article{arxiv.2501.11621,
title = {Trojan Detection Through Pattern Recognition for Large Language Models},
author = {Vedant Bhasin and Matthew Yudin and Razvan Stefanescu and Rauf Izmailov},
journal= {arXiv preprint arXiv:2501.11621},
year = {2025}
}
备注
20 pages, 11 Figures