大型语言模型的宽容信息流分析
机器学习
2026-01-16 v3 人工智能
摘要
大型语言模型(LLM)正迅速成为更大软件系统中的常用组件。这自然引发了安全和隐私问题:从一个组件检索到的受污染数据可以改变模型的行为并损害整个系统,包括迫使模型将机密数据传递给不可信的组件。一个有前景的解决方法是通过动态信息流(即污点)跟踪在系统层面来处理此问题。然而,这种将最严格的输入标签传播到输出上的方法对于 LLM operates on 来自不同来源的输入的应用来说过于保守。在本文中,我们提出了一种更宽容的、用于通过 LLM 查询传播信息流标签的新方法。我们方法的关键思想是仅传播生成模型输出所具有影响力的样本的标签,并消除不必要的输入的标签。我们实现并研究了两种这种方法的变体,基于(i)基于提示的检索增强,和(ii)k-最近邻(k-NN)语言模型。我们将其与使用内省预测输出标签的基线进行比较。我们的实验结果在 LLM agent 环境中显示,宽容标签传播器在超过 85% 的情况下优于基线,这凸显了我们方法的实用性。
引用
@article{arxiv.2410.03055,
title = {Permissive Information-Flow Analysis for Large Language Models},
author = {Shoaib Ahmed Siddiqui and Radhika Gaonkar and Boris Köpf and David Krueger and Andrew Paverd and Ahmed Salem and Shruti Tople and Lukas Wutschitz and Menglin Xia and Santiago Zanella-Béguelin},
journal= {arXiv preprint arXiv:2410.03055},
year = {2026}
}