中文

大语言模型能区分指令与数据吗?这究竟意味着什么?

机器学习 2025-02-03 v3 计算与语言

摘要

经过指令微调的大语言模型 (LLM) 在众多实际应用中表现出令人印象深刻的结果,但它们缺乏计算机科学其他领域常见的基本安全特性,特别是指令与数据的明确分离。这使得它们容易受到间接提示注入等操纵,并且通常不适合安全关键任务。令人惊讶的是,目前尚无既定的定义或基准来量化这一现象。在本工作中,我们通过引入指令 - 数据分离的形式化度量以及可从模型输出计算的实证变体来填补这一空白。我们还提出了一个新的数据集 SEP,可用于估计现实世界模型的该度量。我们在各种 LLM 上的结果表明,指令 - 数据分离的问题是真实存在的:所有模型都无法实现高分离度,而规范的缓解技术(如提示工程和微调)要么无法显著改善分离度,要么会降低模型效用。源代码和 SEP 数据集可在 https://github.com/egozverev/Shold-It-Be-Executed-Or-Processed 公开获取。

关键词

引用

@article{arxiv.2403.06833,
  title  = {Can LLMs Separate Instructions From Data? And What Do We Even Mean By That?},
  author = {Egor Zverev and Sahar Abdelnabi and Soroush Tabesh and Mario Fritz and Christoph H. Lampert},
  journal= {arXiv preprint arXiv:2403.06833},
  year   = {2025}
}

备注

Published as a conference paper at ICLR 2025, GitHub: https://github.com/egozverev/Shold-It-Be-Executed-Or-Processed. 10 pages main text, 30 pages in total