中文

通过类 Few-shot 引导推导的推理时语义污染现象

计算与语言 2026-04-07 v1

摘要

最近的研究表明,对大型语言模型 (LLM) 对不安全代码或文化相关数值代码进行微调会导致潜在的误差alignments,使得模型在无关的下游任务中生成有害内容。该工作的作者得出结论,仅凭 k-shot 提示本身并不会引发此效应。我们重新审视了这一结论,发现推理时语义漂移是真实且可衡量的;然而,这需要模型具备足够的能力。我们通过一个受控实验,在与语义无关的提示之前注入五个文化相关数值进行 few-shot 演示,发现具有丰富文化关联表示能力的模型表现出显著的分布性偏移,倾向于更暗黑、专制和污名化的主题,而较简单/较小的模型则未见此现象。我们还发现,结构上不活跃的演示(无意义字符串)也会扰动输出分布,这表明存在两种可分离的机制:结构格式污染和语义内容污染。我们的结果描绘了推理时污染发生的边界条件,直接影响使用 few-shot 提示的 LLM 应用程序的安全性。

关键词

引用

@article{arxiv.2604.04043,
  title  = {Emergent Inference-Time Semantic Contamination via In-Context Priming},
  author = {Marcin Abram},
  journal= {arXiv preprint arXiv:2604.04043},
  year   = {2026}
}

备注

6 pages, 2 figures, appendix