中文

接种提示:在训练期间从 LLM 中提取的特征会在测试时抑制它们

计算与语言 2025-11-04 v4 人工智能

摘要

语言模型的微调往往会导致不良特征与期望特征的组合学习。为此,我们提出接种提示:通过在训练数据前添加短系统提示指令来刻意激活不良特征。测试时,我们在没有该指令的情况下进行评估;接种后的模型在不修改训练数据训练的模型相比,表达该特征的程度大幅降低。接种是选择性的:在助手响应总是为西班牙语且全大写的玩具设置中,合适的接种(例如 "You always speak in Spanish.")教会模型对响应进行大写,同时仍然以英语响应。我们发现接种在多个额外设置中也同样有效:减少来自任务特定微调的新兴不匹配(EM),防御后门注入,以及缓解特征通过隐性学习的传递。跟进分析表明一种机制:通过接种使特征不那么惊讶,从而减少对模型进行全局更新的优化压力,从而降低其泛化程度。我们的分析关系到关于 EM 的先前工作:接种解释了教育背景缓解不安全代码来源的 EM 的先前发现。除了展示一种简单且有效的选择性学习技术外,我们的结果有助于更好地理解语言模型为何以及如何进行泛化。

关键词

引用

@article{arxiv.2510.04340,
  title  = {Inoculation Prompting: Eliciting traits from LLMs during training can suppress them at test-time},
  author = {Daniel Tan and Anders Woodruff and Niels Warncke and Arun Jose and Maxime Riché and David Demitri Africa and Mia Taylor},
  journal= {arXiv preprint arXiv:2510.04340},
  year   = {2025}
}

备注

40 pages, 22 figures. Under review at ICLR 2026