通过类 Few-shot 引导推导的推理时语义污染现象
计算与语言
2026-04-07 v1
摘要
最近的研究表明,对大型语言模型 (LLM) 对不安全代码或文化相关数值代码进行微调会导致潜在的误差alignments,使得模型在无关的下游任务中生成有害内容。该工作的作者得出结论,仅凭 k-shot 提示本身并不会引发此效应。我们重新审视了这一结论,发现推理时语义漂移是真实且可衡量的;然而,这需要模型具备足够的能力。我们通过一个受控实验,在与语义无关的提示之前注入五个文化相关数值进行 few-shot 演示,发现具有丰富文化关联表示能力的模型表现出显著的分布性偏移,倾向于更暗黑、专制和污名化的主题,而较简单/较小的模型则未见此现象。我们还发现,结构上不活跃的演示(无意义字符串)也会扰动输出分布,这表明存在两种可分离的机制:结构格式污染和语义内容污染。我们的结果描绘了推理时污染发生的边界条件,直接影响使用 few-shot 提示的 LLM 应用程序的安全性。
关键词
引用
@article{arxiv.2604.04043,
title = {Emergent Inference-Time Semantic Contamination via In-Context Priming},
author = {Marcin Abram},
journal= {arXiv preprint arXiv:2604.04043},
year = {2026}
}
备注
6 pages, 2 figures, appendix