以未来事件作为后门触发器:探究 LLM 中的时间漏洞
密码学与安全
2024-12-25 v3 计算与语言
机器学习
摘要
后门是仅在 AI 系统部署后才会被触发的隐藏行为。企图创建成功后门的恶意行为者必须对其进行设计,以避免在训练和评估期间被激活。由于这些阶段使用的数据通常仅包含已经发生的事件信息,因此简单的后门触发器的一个组件可以是模型识别出相对于其训练时间属于未来的数据。通过提示实验和探测内部激活,我们表明当前的大型语言模型(LLM)能够区分过去与未来的事件,对模型激活的探测达到了 90% 的准确率。我们训练了由时间分布偏移触发的后门模型;当模型暴露于超出其训练截止日期的新闻标题时,它们会被激活。在有用、无害和诚实(HHH)数据上进行微调对于移除较简单的后门触发器效果不佳,但对我们的后门模型很有效,尽管在我们测试的较大规模模型上这种差异较小。我们还发现,代表模型内部日期表示的激活引导向量会影响后门激活率。我们将这些结果作为初步证据,表明至少对于我们测试的适度规模模型,标准安全措施足以移除这些后门。
引用
@article{arxiv.2407.04108,
title = {Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs},
author = {Sara Price and Arjun Panickssery and Sam Bowman and Asa Cooper Stickland},
journal= {arXiv preprint arXiv:2407.04108},
year = {2024}
}